Last Translation Benchmark: leaderboard

Metric: Verified Translations (%). Source: last-translation-benchmark.vilda.net. 25 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)39.3
2GPT-5.6 Sol28.1
3GPT-5.6 Luna15.37
4Gemini 3.5 Flash Lite11.86
5Kimi K311.75
6DeepSeek V4 Pro10.76
7Qwen 3.7 Plus10.21
8Gemma 47.14
9Qwen 3.7 Flash5.82
10Nemotron 3 Ultra4.83
11GPT-5.4 Mini2.74
12GemmaX2-28-9B-v0.12.09
13Llama 4 Maverick1.98
14Command A+1.43
15GPT-OSS-20B1.32

Interactive version: theaggregate.ai/benchmark?slug=last-translation-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-08.