HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Human Aging: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.782.96
2Claude Haiku 4.5 (20251001)78.92
3Claude Sonnet 4.678.48
4Qwen 3.5 397B A17B77.58
5Gemini 2.5 Flash (Thinking)75.78
6GPT-5.4 (2026-03-05)74.89
7Qwen 3 Next 80B A3B Instruct73.99
8Gemma 4 31B (IT)73.54
9GPT-4.1 (2025-04-14)72.2
10Qwen 2.5 72B Instruct71.75
11Gemini 2.5 Flash Lite (Thinking)71.75
12Mistral Large 371.3
13Mistral Large 2 (Nov) Instruct (2411)71.3
14GPT-4.1 Mini70.4
15AceGPT-v2-70B-Chat70.4

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-human-aging · How It Works · Data refreshed daily, snapshot 2026-09-19.