HELM Arabic - Arabic Mmlu - Civics (Middle School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.777.54
2GPT-4.1 (2025-04-14)75
3Gemini 2.5 Flash (Thinking)74.58
4Claude Sonnet 4.674.15
5GPT-5.4 (2026-03-05)71.19
6Mistral Large 369.92
7Gemma 4 31B (IT)69.07
8Claude Haiku 4.5 (20251001)67.8
9Qwen 3.5 397B A17B66.95
10Llama 4 Maverick Instruct FP866.1
11DeepSeek V3.165.68
12Gemini 2.5 Flash Lite (Thinking)65.25
13Qwen 3 Next 80B A3B Instruct64.83
14AceGPT-v2-32B-Chat64.83
15GPT-4.1 Mini64.41

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-civics-middle-school · How It Works · Data refreshed daily, snapshot 2026-09-19.