Evals for Every Language - Translation From — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)45
2Gemini 2.5 Pro43.37
3Gemini 2.5 Flash42.24
4Claude Sonnet 4.541.12
5GPT-5.540.95
6Claude Opus 4.740.53
7Gemini 3.1 Flash Lite39.99
8Claude Opus 4.839.86
9GPT-5.438.81
10Claude Sonnet 4.638.72
11Qwen 3.6 Plus38.71
12Gemini 2.5 Flash Lite38.42
13GPT-537.21
14Claude Sonnet 437.2
15GPT-5.137.11

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-translation-from · How the rankings work · Data refreshed daily, snapshot 2026-07-22.