HELM Arabic - Arabic Mmlu - Driving Test: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.785.3
2GPT-4.1 (2025-04-14)83.8
3Gemma 4 31B (IT)83.2
4GPT-5.4 (2026-03-05)83
5Claude Sonnet 4.682.4
6Gemini 2.5 Flash (Thinking)81.6
7GPT-4.1 Mini81
8Qwen 3.5 397B A17B80.3
9Claude Haiku 4.5 (20251001)79.2
10Mistral Large 379.1
11Gemini 2.5 Flash Lite (Thinking)78.9
12Qwen 2.5 72B Instruct78.8
13Mistral Large 2 (Nov) Instruct (2411)78.5
14Llama 4 Maverick Instruct FP877.5
15Llama 4 Scout Instruct77

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-driving-test · How It Works · Data refreshed daily, snapshot 2026-09-19.