Evals for Every Language - Language mag: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)59.83
2Gemini 2.5 Flash59.48
3Gemini 2.5 Pro59.42
4Claude Sonnet 4.559.17
5Claude Opus 4.758.53
6Gemini 3.1 Flash Lite58.12
7Claude Opus 4.857.79
8GPT-5.456.59
9Claude Sonnet 456.24
10GPT-5.356.2
11GPT-5.256.12
12Nova Pro (v1)55.81
13GPT-5.155.57
14GPT-5.553.6
15Claude Sonnet 4.652.97

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mag · How It Works · Data refreshed daily, snapshot 2026-09-05.