HELM Arabic - Alghafa - Meta AR MSA: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.795.64
2Gemma 4 31B (IT)95.31
3Claude Sonnet 4.694.97
4GPT-5.4 (2026-03-05)94.41
5Gemini 2.5 Flash (Thinking)94.19
6Qwen 3.5 397B A17B93.97
7Claude Haiku 4.5 (20251001)92.85
8Llama 3.3 70B Instruct92.63
9Qwen 3 Next 80B A3B Instruct92.63
10Mistral Large 392.4
11GPT-4.1 (2025-04-14)92.29
12Llama 4 Maverick Instruct FP892.29
13Qwen 2.5 72B Instruct91.62
14Gemini 2.5 Flash Lite (Thinking)91.28
15Mistral Large 2 (Nov) Instruct (2411)90.95

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-alghafa-meta-ar-msa · How It Works · Data refreshed daily, snapshot 2026-09-19.