HELM Arabic Enterprise - Arabic Content Generation: leaderboard

Metric: Score. Source: crfm.stanford.edu. 35 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)87.5
2GPT-5.4 (2026-03-05)86.41
3DeepSeek V4 Pro85.1
4Gemini 2.5 Flash (Thinking)80.14
5Claude Opus 4.779.02
6Llama 4 Maverick Instruct78.34
7Qwen3 235B A22B Instruct 2507 FP877.52
8DeepSeek V3.177.36
9Gemini 2.5 Flash Lite (Thinking)75.71
10Claude Haiku 4.5 (20251001)75.68
11Qwen 3.5 9B73.76
12Llama 4 Scout Instruct72.64
13Claude Sonnet 4.672.37
14Llama 3.3 70B Instruct68.81
15AceGPT-v2-70B-Chat68.81

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-enterprise-arabic-content-generation · How It Works · Data refreshed daily, snapshot 2026-09-08.