HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Elementary Mathematics: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.791.01
2Gemma 4 31B (IT)88.1
3Gemini 2.5 Flash (Thinking)87.3
4Claude Sonnet 4.682.8
5Mistral Large 382.8
6Qwen 3.5 397B A17B81.22
7DeepSeek V3.180.95
8GPT-5.4 (2026-03-05)78.57
9Llama 4 Maverick Instruct FP878.31
10Claude Haiku 4.5 (20251001)77.25
11Qwen 3 Next 80B A3B Instruct75.66
12Gemini 2.5 Flash Lite (Thinking)74.87
13Qwen 2.5 72B Instruct73.54
14GPT-4.1 (2025-04-14)68.52
15GPT-4.1 Mini65.87

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-elementary-mathematics · How It Works · Data refreshed daily, snapshot 2026-09-19.