Evals for Every Language - Language ar — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.871.58
2Claude Opus 4.770.69
3Gemini 3.1 Pro (Preview)70.02
4Gemini 2.5 Pro69.69
5Claude Sonnet 4.569.66
6DeepSeek V3.168.89
7Gemini 3.1 Flash Lite68.15
8Grok 4.2067.76
9Claude Sonnet 467.61
10GPT-566.73
11Claude Haiku 4.566.31
12Claude Sonnet 4.665.76
13GPT-5.165.26
14GPT-5.565.19
15Nova Pro (v1)65.17

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ar · How the rankings work · Data refreshed daily, snapshot 2026-07-22.