Evals for Every Language - Language is — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite73.86
2Gemini 3.1 Pro (Preview)72.85
3Gemini 2.5 Pro72.39
4Claude Sonnet 472.37
5Claude Sonnet 4.572.23
6GPT-572.12
7Claude Opus 4.772.09
8Claude Haiku 4.570.92
9GPT-5.170.85
10Kimi K270.59
11GPT-4o70.42
12Claude Opus 4.870.35
13Grok 4.2070.07
14GPT-4.169.6
15Gemma 3 27B (IT)69.21

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-is · How the rankings work · Data refreshed daily, snapshot 2026-07-22.