HELM Arabic - Alghafa - Multiple Choice Grounded Statement Xglue Mlqa Task: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct96.67
2Claude Opus 4.796
3Llama 4 Scout Instruct95.33
4Claude Sonnet 4.694.67
5Mistral Large 394.67
6GPT-4.1 (2025-04-14)94
7Qwen 3 Next 80B A3B Instruct94
8Gemini 2.5 Flash Lite (Thinking)94
9GPT-5.4 (2026-03-05)94
10Gemma 4 31B (IT)93.33
11Qwen 3.5 9B92.67
12Gemini 2.5 Flash (Thinking)92.67
13AceGPT-v2-70B-Chat92.67
14Llama 4 Maverick Instruct FP892
15Llama 3.3 70B Instruct91.33

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-alghafa-multiple-choice-grounded-statement-xglue-mlqa-task · How It Works · Data refreshed daily, snapshot 2026-09-19.