Open Arabic LLM - Arabic MMLU HT Prehistory: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct75.93
2Llama 3.3 70B Instruct72.84
3Qwen 2.5 72B72.53
4Qwentile2.5-32B-Instruct70.68
5Awqward2.5-32B-Instruct69.14
6Gemma 3 27B (IT)68.52
7Qwen 2 72B68.21
8Qwen2.5-32B-Instruct-CFT68.21
9Qwen 2.5 32B Instruct67.9
10gemma-3-27B-pt67.9
11Qwen2.5-32B-Instruct-abliterated-v267.28
12gemma-3-12B-pt64.81
13aya-expanse-32B64.81
14Saka-14B63.89
15EZO-Qwen2.5-32B-Instruct63.27

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-prehistory · How It Works · Data refreshed daily, snapshot 2026-09-05.