Evals for Every Language - Language is: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite73.86
2Gemini 3.1 Pro (Preview)72.85
3Gemini 2.5 Pro72.39
4Claude Sonnet 472.37
5Claude Sonnet 4.572.23
6GPT-572.12
7Claude Opus 4.772.09
8Claude Haiku 4.570.92
9GPT-5.170.85
10Kimi K270.59
11GPT-5.370.54
12GPT-4o70.42
13Claude Opus 4.870.35
14Grok 4.2070.07
15GPT-4.169.6

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-is · How It Works · Data refreshed daily, snapshot 2026-09-05.