CanMT - Japanese to English: leaderboard

Metric: Translation score (1-7) on the 116 Japanese-to-English CanMT sentences containing culture-specific items, GPT-5-nano judge with the reference translation scoring contextual accuracy, cultural adaptation, functional equivalence, fidelity and naturalness on 7-point Likert scales, averaged per sentence; default translation prompt; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 22 models tracked.

Top models

#ModelScore
1GPT-45.18
2Grok 4.15.04
3GPT-4o5.03
4DeepSeek R14.97
5Gemini 2.5 Flash Lite4.96
6DeepSeek V3.24.88
7Qwen 2.5 72B Instruct4.67
8Qwen 2.5 32B Instruct4.6
9Llama 3.3 70B Instruct4.44
10Qwen 3 32B (Non-reasoning)4.39
11Qwen 2.5 14B Instruct4.32
12Qwen 3 14B (Non-reasoning)4.24
13Qwen 3 8B (Non-reasoning)4.02
14Qwen 2.5 7B Instruct3.82
15Qwen 3 4B (Non-reasoning)3.52

Interactive version: theaggregate.ai/benchmark?slug=canmt-japanese-to-english · How It Works · Data refreshed daily, snapshot 2026-10-07.