Evals for Every Language - Language tt — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.870.77
2Claude Opus 4.770.29
3Gemini 3.1 Pro (Preview)69.73
4Claude Sonnet 4.569.46
5GPT-4o69.24
6GPT-568.39
7GPT-5.268.37
8Gemini 2.5 Pro68.09
9Qwen 3.6 Plus68.06
10GPT-5.467.49
11GPT-5.567.26
12GPT-5.166.98
13Grok 4.2066.32
14Gemini 3.1 Flash Lite65.89
15Claude Sonnet 4.665.52

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-tt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.