Open Arabic LLM - Arabic MMLU HT Moral Scenarios: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct64.36
2EZO-Qwen2.5-32B-Instruct58.55
3Qwen 2.5 32B Instruct58.1
4Qwen2.5-32B-Instruct-CFT57.54
5Awqward2.5-32B-Instruct56.98
6Qwen 2.5 72B Instruct55.08
7Saka-14B51.96
8Rombos-LLM-V2.6-Qwen-14B51.62
9Qwen 2 72B51.06
10Qwen2.5-32B-Instruct-abliterated-v250.61
11lambda-qwen2.5-14B-dpo-test50.06
12tempmotacilla-cinerea-030849.61
13Qwentile2.5-32B-Instruct48.38
14aya-expanse-32B46.93
15Qwen2.5-Lumen-14B43.35

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-moral-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-05.