HELM Arabic - Arabic Mmlu: leaderboard

Metric: EM. Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.785.2
2Claude Sonnet 4.682.65
3GPT-5.4 (2026-03-05)81.98
4Gemini 2.5 Flash (Thinking)81.9
5Gemma 4 31B (IT)81.59
6GPT-4.1 (2025-04-14)80.89
7Mistral Large 378.19
8Qwen 3.5 397B A17B78.09
9Claude Haiku 4.5 (20251001)77.35
10Qwen3 235B A22B Instruct 2507 FP877.3
11Llama 4 Maverick Instruct FP877.03
12Gemini 2.5 Flash Lite (Thinking)76.74
13DeepSeek V3.175.66
14Qwen 3 Next 80B A3B Instruct75.59
15Qwen 2.5 72B Instruct74.94

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu · How It Works · Data refreshed daily, snapshot 2026-09-08.