Evals for Every Language - Language lt — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.4
2Claude Sonnet 4.573.1
3Claude Opus 4.871.32
4GPT-5.270.94
5Claude Opus 4.770.44
6GPT-5.569.49
7Claude Sonnet 469.34
8Claude Sonnet 4.668.83
9Gemini 3.1 Flash Lite68.71
10GPT-568.28
11Grok 4.2067.98
12Qwen 3.6 Plus67.92
13GPT-5.467.89
14GLM 4.5 Air67.87
15GPT-5.167.77

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.