Evals for Every Language - Language lb — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.572.87
2Gemini 2.5 Pro72.67
3GPT-571.58
4Gemini 3.1 Pro (Preview)71.44
5Claude Opus 4.871.26
6Claude Sonnet 470.78
7Grok 4.2070.78
8Gemini 3.1 Flash Lite70.35
9GPT-5.169.59
10Claude Opus 4.769.44
11Claude Sonnet 4.669.41
12GPT-5.269.25
13GPT-5.568.73
14Gemini 2.5 Flash Lite68.06
15Qwen 3.6 Plus67.99

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.