HELM Arabic - Mbzuai Human Translated Arabic Mmlu: leaderboard

Metric: EM. Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.787.96
2GPT-5.4 (2026-03-05)83.18
3Claude Sonnet 4.682.97
4Gemini 2.5 Flash (Thinking)80.56
5Gemma 4 31B (IT)80.37
6Qwen 3.5 397B A17B80.28
7Claude Haiku 4.5 (20251001)79.05
8Qwen3 235B A22B Instruct 2507 FP878.33
9GPT-4.1 (2025-04-14)78.2
10Mistral Large 377.31
11Llama 4 Maverick Instruct FP876.43
12Qwen 3 Next 80B A3B Instruct75.07
13DeepSeek V3.174.21
14Qwen 2.5 72B Instruct72.94
15Gemini 2.5 Flash Lite (Thinking)72.55

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu · How It Works · Data refreshed daily, snapshot 2026-09-08.