Open Arabic LLM - Arabic MMLU HT Average — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Ultiima-72B73.9
2Rombos-LLM-V2.5-Qwen-72B73.87
3calme-2.1-qwen2.5-72B73.09
4calme-2.2-qwen2.5-72B72.96
5Qwen 2.5 72B Instruct72.23
6Qwen 2 72B68.06
7Llama 3.3 70B Instruct67.79
8Gemma 3 27B (IT)66.92
9lambda-qwen2.5-32B-dpo-test66.8
10Qwentile2.5-32B-Instruct66.67
11gemma-3-27B-pt66.62
12Qwen 2.5 72B66.44
13Awqward2.5-32B-Instruct66.38
14Qwen 2.5 32B Instruct65.74
15Qwen2.5-32B-Instruct-abliterated-v265.73

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-average · How the rankings work · Data refreshed daily, snapshot 2026-07-22.