Open Arabic LLM - Aratrust Trustfulness — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 162 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct82.05
2Gemma 3 27B (IT)80.77
3Qwen 2.5 32B Instruct80.77
4Qwen 2.5 72B Instruct79.49
5gemma-3-27B-pt79.49
6aya-expanse-32B79.49
7Qwen 2.5 72B78.21
8Qwen2.5-32B-Instruct-abliterated-v278.21
9Awqward2.5-32B-Instruct78.21
10calme-2.2-qwen2.5-72B78.21
11lambda-qwen2.5-32B-dpo-test78.21
12Saka-14B76.92
13Qwen2.5-32B-Instruct-CFT76.92
14EZO-Qwen2.5-32B-Instruct76.92
15calme-2.1-qwen2.5-72B76.92

Interactive version: theaggregate.ai/benchmark?slug=open-arabic-llm-aratrust-trustfulness · How the rankings work · Data refreshed daily, snapshot 2026-07-22.