HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Management: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.789.32
2Qwen 3.5 397B A17B89.32
3Gemini 2.5 Flash (Thinking)85.44
4Claude Sonnet 4.684.47
5Gemma 4 31B (IT)84.47
6GPT-5.4 (2026-03-05)83.5
7Claude Haiku 4.5 (20251001)82.52
8Llama 4 Maverick Instruct FP881.55
9Mistral Large 381.55
10Llama 3.3 70B Instruct80.58
11AceGPT-v2-70B-Chat80.58
12Qwen 2.5 72B Instruct78.64
13GPT-4.1 (2025-04-14)78.64
14Qwen 3 Next 80B A3B Instruct78.64
15Gemini 2.5 Flash Lite (Thinking)78.64

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-management · How It Works · Data refreshed daily, snapshot 2026-09-19.