HELM Arabic - Arabic Mmlu - Economics (Middle School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.789.66
2Gemini 2.5 Flash (Thinking)87.36
3Qwen 3.5 397B A17B85.06
4Claude Sonnet 4.683.91
5GPT-4.1 (2025-04-14)83.91
6Gemma 4 31B (IT)82.76
7AceGPT-v2-32B-Chat82.76
8AceGPT-v2-70B-Chat82.76
9GPT-5.4 (2026-03-05)82.76
10GPT-4.1 Mini81.61
11Qwen 3 Next 80B A3B Instruct81.61
12Gemini 2.5 Flash Lite (Thinking)81.61
13Qwen 2.5 72B Instruct80.46
14Claude Haiku 4.5 (20251001)80.46
15DeepSeek V3.180.46

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-economics-middle-school · How It Works · Data refreshed daily, snapshot 2026-09-19.