HELM Arabic - Arabic Mmlu - History (Middle School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1GPT-5.4 (2026-03-05)82.27
2Claude Opus 4.781.77
3Claude Sonnet 4.680.79
4GPT-4.1 (2025-04-14)80.79
5Llama 4 Maverick Instruct FP878.82
6Gemini 2.5 Flash (Thinking)78.82
7Qwen 3.5 397B A17B77.83
8Mistral Large 377.34
9Qwen 2.5 72B Instruct76.35
10Mistral Large 2 (Nov) Instruct (2411)75.86
11Gemini 2.5 Flash Lite (Thinking)75.86
12AceGPT-v2-70B-Chat75.86
13Gemma 4 31B (IT)75.37
14DeepSeek V3.174.88
15Claude Haiku 4.5 (20251001)74.38

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-history-middle-school · How It Works · Data refreshed daily, snapshot 2026-09-19.