Open Arabic LLM - Arabic MMLU HT Machine Learning — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1calme-2.1-qwen2.5-72B60.71
2Rombos-LLM-V2.5-Qwen-72B60.71
3Ultiima-72B60.71
4calme-2.2-qwen2.5-72B58.93
5Qwen 2.5 72B Instruct56.25
6Qwentile2.5-32B-Instruct56.25
7Qwen 2.5 72B53.57
8Qwen 2 72B53.57
9lambda-qwen2.5-32B-dpo-test53.57
10Awqward2.5-32B-Instruct52.68
11Llama 3.3 70B Instruct50.89
12Qwen2.5-32B-Instruct-CFT50.89
13Qwen 2.5 32B Instruct50
14Qwen 2.5 32B49.11
15Rombos-LLM-V2.6-Qwen-14B49.11

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-machine-learning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.