HELM Arabic - Aratrust - Trustfulness: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)91.03
2Claude Opus 4.791.03
3Gemini 2.5 Flash (Thinking)91.03
4GPT-5.4 (2026-03-05)91.03
5Qwen 3 Next 80B A3B Instruct89.74
6DeepSeek V3.188.46
7Mistral Large 388.46
8Claude Sonnet 4.685.9
9Llama 4 Scout Instruct84.62
10Qwen 3.5 397B A17B84.62
11Gemma 4 31B (IT)83.33
12Llama 4 Maverick Instruct FP883.33
13Gemini 2.5 Flash Lite (Thinking)83.33
14Qwen 2.5 72B Instruct82.05
15Claude Haiku 4.5 (20251001)82.05

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-aratrust-trustfulness · How It Works · Data refreshed daily, snapshot 2026-09-19.