Open Arabic LLM - Arabic MMLU HT Clinical Knowledge — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1calme-2.1-qwen2.5-72B74.72
2calme-2.2-qwen2.5-72B74.72
3Rombos-LLM-V2.5-Qwen-72B74.72
4Ultiima-72B74.34
5Qwen 2.5 72B Instruct72.83
6Llama 3.3 70B Instruct68.68
7gemma-3-27B-pt68.68
8lambda-qwen2.5-32B-dpo-test68.68
9Qwentile2.5-32B-Instruct68.3
10Qwen 2.5 32B Instruct67.92
11Awqward2.5-32B-Instruct67.92
12Qwen2.5-32B-Instruct-CFT67.55
13Gemma 3 27B (IT)67.17
14Qwen 2.5 72B66.42
15Qwen2.5-32B-Instruct-abliterated-v266.04

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-clinical-knowledge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.