HELM Arabic - Arabic Mmlu - General Knowledge: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.788.77
2Claude Sonnet 4.685.3
3GPT-4.1 (2025-04-14)84.61
4GPT-5.4 (2026-03-05)83.45
5Gemini 2.5 Flash (Thinking)83.33
6Gemma 4 31B (IT)81.71
7Mistral Large 381.25
8Qwen 3.5 397B A17B79.05
9Llama 4 Maverick Instruct FP878.82
10DeepSeek V3.178.36
11Claude Haiku 4.5 (20251001)77.55
12Gemini 2.5 Flash Lite (Thinking)76.74
13AceGPT-v2-70B-Chat73.96
14ALLaM-7B-Instruct-preview73.61
15Qwen 3 Next 80B A3B Instruct73.03

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-general-knowledge · How It Works · Data refreshed daily, snapshot 2026-09-19.