HELM Arabic - Arabic Mmlu - Economics (University): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.783.21
2Claude Sonnet 4.682.48
3GPT-5.4 (2026-03-05)82.48
4Gemini 2.5 Flash (Thinking)79.56
5GPT-4.1 (2025-04-14)78.1
6Gemma 4 31B (IT)78.1
7Qwen 3.5 397B A17B76.64
8Claude Haiku 4.5 (20251001)75.18
9Qwen 3 Next 80B A3B Instruct74.45
10Gemini 2.5 Flash Lite (Thinking)70.8
11GPT-4.1 Mini69.34
12Qwen 2.5 72B Instruct68.61
13DeepSeek V3.168.61
14AceGPT-v2-70B-Chat68.61
15Llama 4 Scout Instruct67.15

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-economics-university · How It Works · Data refreshed daily, snapshot 2026-09-19.