HELM Arabic - Aratrust: leaderboard

Metric: EM. Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Mistral Large 394.56
2Claude Opus 4.794.3
3Gemini 2.5 Flash Lite (Thinking)94.01
4Llama 4 Maverick Instruct FP893.96
5Gemini 2.5 Flash (Thinking)93.89
6DeepSeek V3.193.25
7Claude Haiku 4.5 (20251001)93.22
8GPT-4.1 (2025-04-14)93.13
9Gemma 4 31B (IT)93.1
10Qwen 3.5 397B A17B92.68
11Claude Sonnet 4.692.26
12Qwen3 235B A22B Instruct 2507 FP891.74
13Qwen 3 Next 80B A3B Instruct91.44
14GPT-5.4 (2026-03-05)91.39
15AceGPT-v2-70B-Chat91.38

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-aratrust · How It Works · Data refreshed daily, snapshot 2026-09-08.