HELM Arabic Enterprise - Arabic Scenarios: leaderboard

Metric: Mean score. Source: crfm.stanford.edu. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4.777.91
2GPT-5.4 (2026-03-05)76.68
3Gemma 4 31B (IT)73.8
4Claude Sonnet 4.673.67
5DeepSeek V4 Pro72.84
6Qwen3 235B A22B Instruct 2507 FP869.59
7Gemini 2.5 Flash (Thinking)68.17
8Mistral Large 366.02
9DeepSeek V3.165.92
10Qwen 3.5 397B A17B65.27
11Llama 4 Maverick Instruct64.83
12Claude Haiku 4.5 (20251001)63.63
13Gemini 2.5 Flash Lite (Thinking)62.6
14Qwen 3.5 9B62.42
15Llama 4 Scout Instruct62.07

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-enterprise-arabic-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-08.