Open Arabic LLM - Aratrust Unfairness — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 162 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B96.36
2lambda-qwen2.5-14B-dpo-test96.36
3calme-2.1-qwen2.5-72B96.36
4calme-2.2-qwen2.5-72B96.36
5Qwen 2.5 72B Instruct94.55
6Phi-4 Mini Instruct94.55
7Qwen 2.5 14B Instruct94.55
8EZO-Qwen2.5-32B-Instruct94.55
9Qwen 2 72B94.55
10Qwen2.5-14B-Gutenberg-1e-Delta94.55
11Qwen2.5-Lumen-14B94.55
12recoilme-gemma-2-9B-v0.294.55
13Rombos-LLM-V2.6-Qwen-14B94.55
14Rombos-LLM-V2.5-Qwen-72B94.55
15Ultiima-72B94.55

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-aratrust-unfairness · How the rankings work · Data refreshed daily, snapshot 2026-07-22.