Evals for Every Language - Language lo — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)73.65
2Claude Sonnet 470.26
3Claude Opus 4.769.85
4Claude Sonnet 4.669.8
5Claude Sonnet 4.568.85
6Claude Opus 4.868.3
7DeepSeek V3.167.97
8Grok 4.2067.62
9GPT-5.167.4
10GPT-5.566.54
11Claude Haiku 4.566.14
12GPT-5.266.11
13Gemini 3.1 Flash Lite66.06
14Qwen 3.6 Plus65.58
15GPT-5.463.86

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.