Evals for Every Language - Language lb: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.572.87
2Gemini 2.5 Pro72.67
3GPT-571.58
4Gemini 3.1 Pro (Preview)71.44
5Claude Opus 4.871.26
6Claude Sonnet 470.78
7Grok 4.2070.78
8GPT-5.370.66
9Gemini 3.1 Flash Lite70.35
10GPT-5.169.59
11Claude Opus 4.769.44
12Claude Sonnet 4.669.41
13GPT-5.269.25
14GPT-5.568.73
15Gemini 2.5 Flash Lite68.06

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lb · How It Works · Data refreshed daily, snapshot 2026-09-05.