HELM Arabic - Arabic Mmlu - General Knowledge (Primary School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1GPT-5.4 (2026-03-05)85.19
2Claude Opus 4.783.33
3GPT-4.1 (2025-04-14)82.1
4Gemma 4 31B (IT)82.1
5Llama 4 Maverick Instruct FP881.48
6Gemini 2.5 Flash (Thinking)81.48
7Qwen 3.5 397B A17B80.86
8Claude Sonnet 4.680.25
9DeepSeek V3.180.25
10Gemini 2.5 Flash Lite (Thinking)80.25
11Qwen 3.5 9B79.63
12Qwen 2.5 72B Instruct79.01
13Claude Haiku 4.5 (20251001)79.01
14Mistral Large 379.01
15Qwen 3 Next 80B A3B Instruct78.4

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-general-knowledge-primary-school · How It Works · Data refreshed daily, snapshot 2026-09-19.