HELM Arabic - Arabic Mmlu - Social Science (Middle School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.764.32
2GPT-5.4 (2026-03-05)62.66
3Llama 3.3 70B Instruct62.24
4Mistral Large 362.24
5GPT-4.1 (2025-04-14)61.83
6Gemma 4 31B (IT)61.41
7Llama 4 Maverick Instruct FP861.41
8Gemini 2.5 Flash (Thinking)61.41
9Llama 4 Scout Instruct61
10Qwen 3 Next 80B A3B Instruct60.58
11Qwen 3.5 397B A17B60.58
12Claude Sonnet 4.660.17
13Qwen 2.5 72B Instruct59.34
14DeepSeek V3.159.34
15Claude Haiku 4.5 (20251001)58.92

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-social-science-middle-school · How It Works · Data refreshed daily, snapshot 2026-09-19.