M-GATE - Round-Trip Translation (Hard Subset): leaderboard

Metric: Mean normalized judge score over 29 target languages (0-1; hard subset). Source: arxiv.org. 82 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)0.82
2GPT-5.5 (High)0.82
3Claude Fable 50.81
4GPT-5.5 (Medium)0.81
5GPT-5.4 (Medium)0.8
6GPT-50.78
7Claude Opus 4.6 (Thinking)0.78
8Gemini 3.1 Pro (Preview)0.77
9Gemini 3.5 Flash0.77
10GPT-5.4 Mini (High)0.77
11Gemini 3.5 Flash (High)0.77
12Claude Opus 4.5 (Thinking)0.77
13GPT-5.4 Mini (Medium)0.76
14GPT-5.2 (High)0.76
15Gemini 2.5 Pro0.75

Interactive version: theaggregate.ai/benchmark?slug=m-gate-round-trip-translation-hard-subset · How It Works · Data refreshed daily, snapshot 2026-09-19.