Open Arabic LLM - Arabic MMLU HT Moral Disputes: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct74.86
2Qwen 2.5 72B Instruct73.7
3Qwen 2 72B71.39
4Qwentile2.5-32B-Instruct68.79
5Qwen2.5-32B-Instruct-abliterated-v268.21
6Awqward2.5-32B-Instruct67.34
7free-evo-qwen72B-v0.8-re67.34
8Gemma 3 27B (IT)66.76
9Qwen 2.5 32B Instruct66.47
10gemma-3-27B-pt66.18
11Qwen2.5-32B-Instruct-CFT66.18
12Saka-14B65.61
13EZO-Qwen2.5-32B-Instruct65.61
14Gemma 2 27B (IT)65.32
15Qwen3-8B-Base65.03

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-moral-disputes · How It Works · Data refreshed daily, snapshot 2026-09-05.