HELM Arabic - Madinah Qa: leaderboard

Metric: EM. Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.790.95
2Gemini 2.5 Flash (Thinking)90.22
3Claude Sonnet 4.689.94
4Gemma 4 31B (IT)89.27
5GPT-5.4 (2026-03-05)86.96
6GPT-4.1 (2025-04-14)86.58
7Gemini 2.5 Flash Lite (Thinking)85.84
8Claude Haiku 4.5 (20251001)84.81
9Qwen3 235B A22B Instruct 2507 FP883.96
10Llama 4 Maverick Instruct FP883.49
11Mistral Large 382.75
12GPT-4.1 Mini82.6
13Qwen 3.5 397B A17B82.45
14Qwen 3 Next 80B A3B Instruct80.87
15DeepSeek V3.180.05

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-madinah-qa · How It Works · Data refreshed daily, snapshot 2026-09-08.