Open Arabic LLM - Arabic MMLU HT Moral Scenarios — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct64.36
2EZO-Qwen2.5-32B-Instruct58.55
3Qwen 2.5 32B Instruct58.1
4lambda-qwen2.5-32B-dpo-test57.88
5Qwen2.5-32B-Instruct-CFT57.54
6Awqward2.5-32B-Instruct56.98
7Qwen 2.5 72B Instruct55.08
8calme-2.1-qwen2.5-72B53.97
9calme-2.2-qwen2.5-72B53.97
10Ultiima-72B53.97
11Rombos-LLM-V2.5-Qwen-72B53.74
12Saka-14B51.96
13Rombos-LLM-V2.6-Qwen-14B51.62
14Qwen 2 72B51.06
15Qwen2.5-32B-Instruct-abliterated-v250.61

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-moral-scenarios · How the rankings work · Data refreshed daily, snapshot 2026-07-22.