Evals for Every Language - Language lt: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.4
2Claude Sonnet 4.573.1
3Claude Opus 4.871.32
4GPT-5.270.94
5Claude Opus 4.770.44
6GPT-5.370.13
7GPT-5.569.49
8Claude Sonnet 469.34
9Claude Sonnet 4.668.83
10Gemini 3.1 Flash Lite68.71
11GPT-568.28
12Grok 4.2067.98
13Qwen 3.6 Plus67.92
14GPT-5.467.89
15GLM 4.5 Air67.87

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lt · How It Works · Data refreshed daily, snapshot 2026-09-05.