Multilingual MMLU - Arabic — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 17 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet78.48
2Qwen 2.5 72B Instruct74.31
3Qwen 2 72B Instruct72.02
4Llama 3.1 70B Instruct71.08
5GPT-4o Mini62.65
6aya-expanse-32B61.57
7Llama 3 70B Instruct60.63
8Qwen 2.5 7B Instruct56.4
9aya-23-35B51.84
10Qwen 2 7B Instruct50.71
11aya-expanse-8B48.75
12Llama 3.1 8B Instruct42.19
13aya-23-8B42.07
14Llama 3 8B Instruct40.54

Interactive version: theaggregate.ai/benchmark?slug=multilingual-mmlu-arabic · How the rankings work · Data refreshed daily, snapshot 2026-07-22.