HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Us Foreign Policy: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.793
2Claude Sonnet 4.691
3GPT-4.1 (2025-04-14)91
4GPT-5.4 (2026-03-05)91
5Claude Haiku 4.5 (20251001)89
6Qwen 3.5 397B A17B89
7Gemini 2.5 Flash (Thinking)89
8Gemma 4 31B (IT)88
9Mistral Large 388
10DeepSeek V3.187
11GPT-4.1 Mini85
12Llama 3.3 70B Instruct85
13Llama 4 Maverick Instruct FP885
14Gemini 2.5 Flash Lite (Thinking)85
15Qwen 3 Next 80B A3B Instruct84

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-us-foreign-policy · How It Works · Data refreshed daily, snapshot 2026-09-19.