Evals for Every Language - Language it — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.773.92
2Gemini 3.1 Pro (Preview)73.73
3Claude Opus 4.873.72
4Claude Sonnet 4.573.44
5Claude Sonnet 4.672.96
6Claude Sonnet 472.95
7GPT-5.172.95
8Grok 4.2072.51
9Gemini 3.1 Flash Lite71.75
10Gemini 2.5 Pro71.59
11Claude Haiku 4.571.57
12GPT-5.271.29
13Mistral Medium 3.171.25
14Qwen 3.6 Plus71.11
15GPT-570.86

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-it · How the rankings work · Data refreshed daily, snapshot 2026-07-22.