Evals for Every Language - Translation To — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)41.34
2Gemini 2.5 Pro40.82
3Claude Opus 4.739.5
4GPT-5.539.31
5Gemini 2.5 Flash39.12
6Claude Opus 4.838.22
7Claude Sonnet 4.538.07
8Gemini 3.1 Flash Lite37.99
9GPT-5.437.74
10Qwen 3.6 Plus36.55
11Claude Sonnet 436.4
12GPT-5.236.14
13Claude Sonnet 4.635.17
14Grok 4.2034.82
15GPT-534.65

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-translation-to · How the rankings work · Data refreshed daily, snapshot 2026-07-22.