Evals for Every Language - Translation To: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)41.34
2Gemini 2.5 Pro40.82
3Claude Opus 4.739.5
4GPT-5.539.31
5Gemini 2.5 Flash39.12
6Claude Opus 4.838.22
7Claude Sonnet 4.538.07
8Gemini 3.1 Flash Lite37.99
9GPT-5.437.74
10Qwen 3.6 Plus36.55
11Claude Sonnet 436.4
12GPT-5.336.27
13GPT-5.236.14
14Claude Sonnet 4.635.17
15Grok 4.2034.82

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-translation-to · How It Works · Data refreshed daily, snapshot 2026-09-05.