HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Moral Disputes: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.786.99
2GPT-5.4 (2026-03-05)84.39
3Claude Sonnet 4.682.66
4GPT-4.1 (2025-04-14)79.77
5Gemini 2.5 Flash (Thinking)79.48
6Claude Haiku 4.5 (20251001)78.61
7Gemma 4 31B (IT)78.32
8Qwen 3.5 397B A17B78.03
9Mistral Large 375.72
10Llama 3.3 70B Instruct74.86
11Llama 4 Maverick Instruct FP873.7
12DeepSeek V3.173.41
13Qwen 3 Next 80B A3B Instruct72.25
14GPT-4.1 Mini71.97
15Qwen 2.5 72B Instruct70.81

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-moral-disputes · How It Works · Data refreshed daily, snapshot 2026-09-19.