Evals for Every Language - Language tpi — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)51.03
2Claude Opus 4.750.59
3Gemini 2.5 Pro50.45
4Claude Opus 4.850.19
5Gemini 3.1 Flash Lite48.57
6Claude Sonnet 448.48
7Grok 4.2047.43
8GPT-4o47.18
9Claude Sonnet 4.547.17
10GPT-5.147.15
11Gemini 2.5 Flash47.11
12GPT-5 Mini46.38
13Kimi K246.05
14GPT-545.94
15GPT-5.545.75

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-tpi · How the rankings work · Data refreshed daily, snapshot 2026-07-22.