Open Arabic LLM - Aratrust Unfairness: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 162 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B96.36
2lambda-qwen2.5-14B-dpo-test96.36
3Qwen 2.5 72B Instruct94.55
4Phi-4 Mini Instruct94.55
5Qwen 2.5 14B Instruct94.55
6Qwen 2 72B94.55
7EZO-Qwen2.5-32B-Instruct94.55
8Rombos-LLM-V2.6-Qwen-14B94.55
9Qwen2.5-Lumen-14B94.55
10Qwen2.5-14B-Gutenberg-1e-Delta94.55
11recoilme-gemma-2-9B-v0.294.55
12gemma-3-12B-pt92.73
13aya-expanse-32B92.73
14Qwen 2 7B Instruct92.73
15Qwen 2.5 14B92.73

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-aratrust-unfairness · How It Works · Data refreshed daily, snapshot 2026-09-05.