IFMTBench - Single-Constraint Translation Quality: leaderboard

Metric: xCOMET-XXL translation quality (%) on the 4,506 single-constraint items, translation requests into seven languages with instructions paraphrased in all seven, officially recommended decoding with non-thinking mode for open models; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 15 models tracked.

Top models

#ModelScore
1Hy-MT2-30B-A3B85.55
2Gemma 4 31B83.56
3Gemini 3.1 Pro (Preview)83.31
4Gemma 4 26B A4B83.3
5Qwen 3.5 27B (Non-reasoning)82.64
6Qwen 3.6 35B A3B (Non-reasoning)82.56
7Gemma 4 E4B82.26
8Qwen 3.5 35B A3B (Non-reasoning)81.74
9Qwen 3.5 9B (Non-reasoning)80.8
10Hy-MT2-1.8B80.74
11Gemma 4 E2B80.22
12Qwen 3.5 4B (Non-reasoning)80.16
13Qwen 3.5 2B (Non-reasoning)75.77
14Qwen 3.5 0.8B (Non-reasoning)70.21

Interactive version: theaggregate.ai/benchmark?slug=ifmtbench-single-constraint-translation-quality · How It Works · Data refreshed daily, snapshot 2026-10-07.