HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Machine Learning: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.791.96
2GPT-5.4 (2026-03-05)77.68
3Claude Sonnet 4.672.32
4Gemma 4 31B (IT)72.32
5Claude Haiku 4.5 (20251001)72.32
6Qwen 3.5 397B A17B66.07
7Gemini 2.5 Flash (Thinking)65.18
8GPT-4.1 (2025-04-14)63.39
9GPT-4.1 Mini60.71
10Qwen 2.5 72B Instruct59.82
11Qwen 3 Next 80B A3B Instruct58.93
12Mistral Large 2 (Nov) Instruct (2411)55.36
13Mistral Large 354.46
14Llama 4 Maverick Instruct FP853.57
15Llama 4 Scout Instruct51.79

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-machine-learning · How It Works · Data refreshed daily, snapshot 2026-09-19.