HELM Arabic Enterprise - Arabic Finance Calculation: leaderboard

Metric: Accuracy. Source: crfm.stanford.edu. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4.775.34
2Claude Sonnet 4.664.84
3DeepSeek V4 Pro63.47
4Qwen3 235B A22B Instruct 2507 FP863.01
5GPT-5.4 (2026-03-05)62.56
6Llama 4 Maverick Instruct60.27
7Gemma 4 31B (IT)59.36
8DeepSeek V3.157.99
9Qwen 3.5 397B A17B55.25
10Gemini 2.5 Flash (Thinking)54.79
11Mistral Large 353.88
12Claude Haiku 4.5 (20251001)52.51
13Gemini 2.5 Flash Lite (Thinking)50.68
14Qwen 3.5 9B49.77
15Llama 4 Scout Instruct46.12

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-enterprise-arabic-finance-calculation · How It Works · Data refreshed daily, snapshot 2026-09-08.