HELM Arabic - Arabic Scenarios: leaderboard

Metric: Mean score. Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.784.08
2Gemini 2.5 Flash (Thinking)82.48
3GPT-5.4 (2026-03-05)82.46
4Gemma 4 31B (IT)82.34
5Claude Sonnet 4.681.49
6GPT-4.1 (2025-04-14)81.37
7Qwen 3.5 397B A17B80.24
8Qwen3 235B A22B Instruct 2507 FP879.51
9Gemini 2.5 Flash Lite (Thinking)79.49
10Llama 4 Maverick Instruct FP879.13
11Mistral Large 378.96
12Claude Haiku 4.5 (20251001)78.83
13Qwen 3 Next 80B A3B Instruct78.39
14DeepSeek V3.177.86
15Qwen 2.5 72B Instruct76.9

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-08.