QIMMA - ArabicMMLU: leaderboard

Metric: Accuracy (%, log-likelihood multiple choice). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Jais-2-70B-Chat81.29
2Qwen 3.5 397B A17B77.54
3Gemma 4 31B77.25
4Jais-2-8B-Chat73.96
5Qwen 2.5 72B Instruct73.78
6Qwen 3.5 122B A10B73.17
7ALLaM-7B-Instruct-preview72.54
8gemma-3-27B-pt72.27
9AIC-172.02
10Llama 3.3 70B Instruct71.57
11Gemma 4 26B A4B71.14
12AceGPT-v2-32B-Chat70.62
13Qwen 3.5 27B69.47
14Qwen 2.5 32B Instruct68.76
15Fanar-1-9B-Instruct67.39

Interactive version: theaggregate.ai/benchmark?slug=qimma-arabicmmlu · How It Works · Data refreshed daily, snapshot 2026-09-19.