Open Arabic LLM - Arabic MMLU HT Moral Disputes — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct74.86
2calme-2.1-qwen2.5-72B74.86
3Rombos-LLM-V2.5-Qwen-72B74.86
4Ultiima-72B74.86
5calme-2.2-qwen2.5-72B74.57
6Qwen 2.5 72B Instruct73.7
7Qwen 2 72B71.39
8Qwentile2.5-32B-Instruct68.79
9Qwen2.5-32B-Instruct-abliterated-v268.21
10Awqward2.5-32B-Instruct67.34
11free-evo-qwen72B-v0.8-re67.34
12Gemma 3 27B (IT)66.76
13Qwen 2.5 32B Instruct66.47
14gemma-3-27B-pt66.18
15Qwen2.5-32B-Instruct-CFT66.18

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-moral-disputes · How the rankings work · Data refreshed daily, snapshot 2026-07-22.