Evals for Every Language - Language tt: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.870.77
2Claude Opus 4.770.29
3Gemini 3.1 Pro (Preview)69.73
4GPT-5.369.52
5Claude Sonnet 4.569.46
6GPT-4o69.24
7GPT-568.39
8GPT-5.268.37
9Gemini 2.5 Pro68.09
10Qwen 3.6 Plus68.06
11GPT-5.467.49
12GPT-5.567.26
13GPT-5.166.98
14Grok 4.2066.32
15Gemini 3.1 Flash Lite65.89

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-tt · How It Works · Data refreshed daily, snapshot 2026-09-05.