HELM Arabic - Mbzuai Human Translated Arabic Mmlu - College Medicine: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.789.6
2Claude Sonnet 4.686.13
3GPT-5.4 (2026-03-05)84.97
4Qwen 3.5 397B A17B84.39
5GPT-4.1 (2025-04-14)82.08
6Claude Haiku 4.5 (20251001)82.08
7Gemini 2.5 Flash (Thinking)82.08
8Gemma 4 31B (IT)80.35
9Mistral Large 378.03
10Llama 4 Maverick Instruct FP877.46
11Qwen 3 Next 80B A3B Instruct76.3
12DeepSeek V3.173.99
13GPT-4.1 Mini72.83
14Gemini 2.5 Flash Lite (Thinking)72.25
15Qwen 2.5 72B Instruct70.52

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-college-medicine · How It Works · Data refreshed daily, snapshot 2026-09-19.