Evals for Every Language - Language war — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)61.02
2Gemini 2.5 Pro60.79
3Claude Opus 4.758.17
4Gemini 2.5 Flash57.49
5Claude Opus 4.857.14
6Gemini 3.1 Flash Lite56.89
7GPT-4o56.85
8Claude Sonnet 4.556.21
9GPT-5.155.25
10GPT-5.555.01
11Claude Sonnet 454.83
12Claude Sonnet 4.654.49
13GPT-553.54
14GPT-5.453.33
15Grok 4.2053.3

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-war · How the rankings work · Data refreshed daily, snapshot 2026-07-22.