HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Human Sexuality: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.790.08
2GPT-5.4 (2026-03-05)90.08
3Claude Sonnet 4.685.5
4Gemini 2.5 Flash (Thinking)85.5
5Llama 4 Maverick Instruct FP884.73
6GPT-4.1 (2025-04-14)83.97
7Gemma 4 31B (IT)83.97
8Qwen 3.5 397B A17B83.97
9DeepSeek V3.180.92
10Qwen 2.5 72B Instruct77.86
11Claude Haiku 4.5 (20251001)77.86
12AceGPT-v2-70B-Chat77.86
13Mistral Large 377.1
14Qwen 3 Next 80B A3B Instruct76.34
15GPT-4.1 Mini74.81

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-human-sexuality · How It Works · Data refreshed daily, snapshot 2026-09-19.