Arabic Broad Leaderboard - MMLU: leaderboard

Metric: Average Score (0-10). Source: huggingface.co. 111 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite10
2GPT-5.29.92
3GPT-6 Pro9.92
4Claude 3.7 Sonnet (20250219)9.84
5Qwen 3.5 397B A17B9.84
6Gemini 3.7 Flash9.84
7Muse Spark 1.19.84
8c4ai-command-a-03-20259.84
9Qwen 3.5 27B9.75
10Gemini 3.5 Flash9.75
11Muse Glimmer 30B9.75
12Gemma 4 31B (IT)9.67
13GPT-5 Mini9.67
14Qwen 3.6 27B9.67
15Claude Sonnet 4 (20250514)9.67

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard-mmlu · How It Works · Data refreshed daily, snapshot 2026-09-19.