HELM Arabic - Alrage: leaderboard

Metric: Score. Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1GPT-5.4 (2026-03-05)92.33
2Gemma 4 31B (IT)91.63
3Qwen 3.5 397B A17B91.51
4Gemini 2.5 Flash (Thinking)89.55
5Qwen 3.5 9B89.51
6Qwen 3 Next 80B A3B Instruct89
7GPT-4.1 (2025-04-14)88.96
8Qwen3 235B A22B Instruct 2507 FP888.96
9Gemini 2.5 Flash Lite (Thinking)88.18
10DeepSeek V3.187.62
11GPT-4.1 Mini87.4
12Mistral Large 385.46
13ALLaM-7B-Instruct-preview85.21
14Claude Opus 4.785.03
15Llama 4 Maverick Instruct FP884.62

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-alrage · How It Works · Data refreshed daily, snapshot 2026-09-08.