HELM Arabic - Arabic Mmlu - Social Science (Primary School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.789.93
2Claude Sonnet 4.688.23
3GPT-4.1 (2025-04-14)87.66
4Gemini 2.5 Flash (Thinking)87.52
5Gemma 4 31B (IT)87.38
6GPT-5.4 (2026-03-05)86.81
7Qwen 3.5 397B A17B85.96
8Llama 4 Maverick Instruct FP885.53
9Gemini 2.5 Flash Lite (Thinking)84.26
10Qwen 3 Next 80B A3B Instruct84.11
11Mistral Large 384.11
12AceGPT-v2-70B-Chat83.97
13GPT-4.1 Mini83.83
14Qwen 2.5 72B Instruct83.55
15Claude Haiku 4.5 (20251001)83.55

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-social-science-primary-school · How It Works · Data refreshed daily, snapshot 2026-09-19.