Open Arabic LLM - Arabic MMLU HT Logical Fallacies — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 163 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct76.69
2Ultiima-72B76.69
3Rombos-LLM-V2.5-Qwen-72B76.07
4calme-2.1-qwen2.5-72B74.23
5calme-2.2-qwen2.5-72B73.62
6Qwen 2 72B73.01
7Gemma 3 27B (IT)71.17
8Qwentile2.5-32B-Instruct71.17
9gemma-3-27B-pt70.55
10Awqward2.5-32B-Instruct69.33
11lambda-qwen2.5-32B-dpo-test69.33
12Llama 3.3 70B Instruct68.71
13Qwen 2.5 72B68.71
14Qwen2.5-32B-Instruct-abliterated-v268.71
15Gemma 2 27B (IT)68.1

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-arabic-mmlu-ht-logical-fallacies · How the rankings work · Data refreshed daily, snapshot 2026-07-22.