HELM Arabic - Arabic Mmlu - General Knowledge (Middle School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)86.63
2Claude Opus 4.786.63
3Claude Sonnet 4.686.05
4Qwen 3.5 397B A17B84.88
5Mistral Large 384.88
6GPT-5.4 (2026-03-05)84.88
7Qwen 2.5 72B Instruct83.72
8Gemini 2.5 Flash (Thinking)83.72
9GPT-4.1 (2025-04-14)83.14
10Qwen 3 Next 80B A3B Instruct83.14
11Claude Haiku 4.5 (20251001)82.56
12Gemini 2.5 Flash Lite (Thinking)82.56
13Llama 4 Maverick Instruct FP881.98
14Llama 4 Scout Instruct79.65
15Qwen 3.5 9B79.65

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-general-knowledge-middle-school · How It Works · Data refreshed daily, snapshot 2026-09-19.