Multilingual MMLU Leaderboard — leaderboard

Multilingual MMLU evaluation averaging translated MMLU-style accuracy across many non-English languages.

Metric: Average Accuracy (%). Source: huggingface.co. Status: saturated. 17 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet77.39
2Llama 3.1 70B Instruct71.67
3Qwen 2 72B Instruct69.15
4Qwen 2.5 72B Instruct69.05
5Llama 3 70B Instruct64.3
6GPT-4o Mini62.63
7aya-expanse-32B58.92
8Qwen 2.5 7B Instruct56.08
9Qwen 2 7B Instruct51.95
10aya-23-35B50.13
11Llama 3.1 8B Instruct50.01
12aya-expanse-8B48.2
13Llama 3 8B Instruct46.57
14aya-23-8B40.96

Interactive version: theaggregate.ai/benchmark?slug=multilingual-mmlu-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.