HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Clinical Knowledge: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.789.43
2GPT-5.4 (2026-03-05)88.3
3Claude Sonnet 4.687.55
4Qwen 3.5 397B A17B85.28
5Claude Haiku 4.5 (20251001)83.77
6Mistral Large 381.89
7Gemma 4 31B (IT)81.51
8GPT-4.1 (2025-04-14)80.38
9Qwen 3 Next 80B A3B Instruct78.49
10DeepSeek V3.178.49
11Gemini 2.5 Flash (Thinking)78.49
12Llama 4 Maverick Instruct FP878.11
13GPT-4.1 Mini77.74
14Gemini 2.5 Flash Lite (Thinking)74.72
15AceGPT-v2-70B-Chat73.58

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-clinical-knowledge · How It Works · Data refreshed daily, snapshot 2026-09-19.