IFMTBench - Multi-Constraint Translation Quality: leaderboard

Metric: xCOMET-XXL translation quality (%) on the 2,838 multi-constraint items, translation requests into seven languages with instructions paraphrased in all seven, officially recommended decoding with non-thinking mode for open models; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 15 models tracked.

Top models

#ModelScore
1Hy-MT2-30B-A3B74.79
2Gemini 3.1 Pro (Preview)69.65
3Gemma 4 26B A4B69.61
4Gemma 4 31B69.5
5Qwen 3.5 27B (Non-reasoning)69.29
6Qwen 3.6 35B A3B (Non-reasoning)68.91
7Qwen 3.5 35B A3B (Non-reasoning)68.48
8Hy-MT2-1.8B67.8
9Gemma 4 E4B67.77
10Qwen 3.5 9B (Non-reasoning)67.62
11Gemma 4 E2B66.92
12Qwen 3.5 4B (Non-reasoning)66.44
13Qwen 3.5 2B (Non-reasoning)61.83
14Qwen 3.5 0.8B (Non-reasoning)52.74

Interactive version: theaggregate.ai/benchmark?slug=ifmtbench-multi-constraint-translation-quality · How It Works · Data refreshed daily, snapshot 2026-10-07.