Open Arabic LLM - Arabic MMLU HT Clinical Knowledge: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct72.83
2Llama 3.3 70B Instruct68.68
3gemma-3-27B-pt68.68
4Qwentile2.5-32B-Instruct68.3
5Qwen 2.5 32B Instruct67.92
6Awqward2.5-32B-Instruct67.92
7Qwen2.5-32B-Instruct-CFT67.55
8Gemma 3 27B (IT)67.17
9Qwen 2.5 72B66.42
10Qwen2.5-32B-Instruct-abliterated-v266.04
11tempmotacilla-cinerea-030866.04
12Saka-14B65.66
13Qwen 2 72B64.53
14Gemma 2 27B (IT)64.15
15Qwen3-8B-Base63.77

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-clinical-knowledge · How It Works · Data refreshed daily, snapshot 2026-09-05.