Evals for Every Language - Language ars — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 453.43
2Gemini 2.5 Flash Lite53.25
3Command A52.85
4Gemini 2.5 Flash52.45
5Claude Sonnet 4.552.07
6Gemini 2.5 Pro51.41
7GPT-4o50.57
8Llama 4 Maverick50.51
9Qwen 3 30B A3B 2507 Instruct50.46
10Gemini 3.1 Pro (Preview)50.3
11Nova Pro (v1)50.29
12Claude Opus 4.749.83
13GPT-5 Nano49.79
14Gemma 3 27B (IT)49.33
15Gemini 3.1 Flash Lite49.28

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ars · How the rankings work · Data refreshed daily, snapshot 2026-07-22.