HELM Arabic - Aratrust - Unfairness: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (20251001)100
2Qwen 3.5 9B96.36
3Gemini 2.5 Flash Lite (Thinking)96.36
4GPT-4.1 Mini94.55
5Qwen 2.5 72B Instruct94.55
6Claude Sonnet 4.694.55
7GPT-4.1 (2025-04-14)94.55
8Llama 4 Maverick Instruct FP894.55
9DeepSeek V3.194.55
10Qwen 3.5 397B A17B94.55
11Mistral Large 394.55
12Mistral Large 2 (Nov) Instruct (2411)94.55
13AceGPT-v2-70B-Chat94.55
14GPT-4.1 Nano92.73
15Gemma 4 31B (IT)92.73

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-aratrust-unfairness · How It Works · Data refreshed daily, snapshot 2026-09-19.