HELM Arabic - Arabic Exams - Science: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.695.65
2Claude Opus 4.794.78
3Qwen 3 Next 80B A3B Instruct94.78
4Llama 3.3 70B Instruct93.91
5Gemini 2.5 Flash Lite (Thinking)93.91
6Llama 4 Maverick Instruct FP893.04
7Qwen 3.5 397B A17B93.04
8Gemini 2.5 Flash (Thinking)93.04
9Gemma 4 31B (IT)92.17
10Claude Haiku 4.5 (20251001)92.17
11GPT-4.1 (2025-04-14)91.3
12DeepSeek V3.191.3
13GPT-5.4 (2026-03-05)91.3
14GPT-4.1 Mini90.43
15Llama 4 Scout Instruct90.43

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-exams-science · How It Works · Data refreshed daily, snapshot 2026-09-19.