Evals for Every Language - Language et — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro72.6
2Gemini 3.1 Pro (Preview)72.6
3GPT-5.572.25
4Gemini 3.1 Flash Lite71.84
5Claude Opus 4.771.59
6Claude Sonnet 4.670.94
7Claude Opus 4.870.93
8Claude Sonnet 4.570.84
9Claude Sonnet 469.89
10GPT-569.85
11Grok 4.2068.82
12Qwen 3.6 Plus68.24
13GPT-5.267.68
14GPT-5 Mini67.38
15GPT-4o67.26

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-et · How the rankings work · Data refreshed daily, snapshot 2026-07-22.