HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Prehistory: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.790.74
2GPT-5.4 (2026-03-05)88.58
3Claude Sonnet 4.687.35
4GPT-4.1 (2025-04-14)86.11
5Gemini 2.5 Flash (Thinking)85.8
6Gemma 4 31B (IT)81.79
7Mistral Large 381.17
8Qwen 3.5 397B A17B80.86
9Qwen 3 Next 80B A3B Instruct78.7
10Claude Haiku 4.5 (20251001)78.4
11Qwen 2.5 72B Instruct76.85
12Llama 4 Maverick Instruct FP876.85
13DeepSeek V3.175.62
14Gemini 2.5 Flash Lite (Thinking)75
15GPT-4.1 Mini74.69

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-prehistory · How It Works · Data refreshed daily, snapshot 2026-09-19.