HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Miscellaneous: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.793.3
2GPT-5.4 (2026-03-05)91.9
3Gemini 2.5 Flash (Thinking)90.7
4Claude Sonnet 4.690.4
5GPT-4.1 (2025-04-14)90
6Mistral Large 388.2
7Claude Haiku 4.5 (20251001)87.8
8Gemma 4 31B (IT)87.3
9Qwen 3.5 397B A17B85.9
10Qwen 3 Next 80B A3B Instruct84.6
11Llama 4 Maverick Instruct FP884
12DeepSeek V3.183.9
13Qwen 2.5 72B Instruct83.8
14Gemini 2.5 Flash Lite (Thinking)83.3
15GPT-4.1 Mini83

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-miscellaneous · How It Works · Data refreshed daily, snapshot 2026-09-19.