Evals for Every Language - Language mag — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)59.83
2Gemini 2.5 Flash59.48
3Gemini 2.5 Pro59.42
4Claude Sonnet 4.559.17
5Claude Opus 4.758.53
6Gemini 3.1 Flash Lite58.12
7Claude Opus 4.857.79
8GPT-5.456.59
9Claude Sonnet 456.24
10GPT-5.256.12
11Nova Pro (v1)55.81
12GPT-5.155.57
13GPT-5.553.6
14Claude Sonnet 4.652.97
15GPT-4o52.42

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mag · How the rankings work · Data refreshed daily, snapshot 2026-07-22.