HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Professional Law: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.785.6
2GPT-5.4 (2026-03-05)79.8
3Claude Sonnet 4.679.5
4Gemini 2.5 Flash (Thinking)77.1
5Qwen 3.5 397B A17B75.4
6Gemma 4 31B (IT)74.8
7GPT-4.1 (2025-04-14)74.6
8Claude Haiku 4.5 (20251001)72.3
9Llama 4 Maverick Instruct FP870.4
10Mistral Large 369.7
11Qwen 3 Next 80B A3B Instruct69.4
12DeepSeek V3.168.4
13Qwen 2.5 72B Instruct67.7
14GPT-4.1 Mini67.2
15Gemini 2.5 Flash Lite (Thinking)67.2

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-professional-law · How It Works · Data refreshed daily, snapshot 2026-09-19.