CanMT: leaderboard

Metric: Mean translation score (1-7) over the 12 CanMT directions (unweighted mean of the direction scores), GPT-5-nano judge with the reference translation scoring contextual accuracy, cultural adaptation, functional equivalence, fidelity and naturalness on 7-point Likert scales, averaged per sentence; default translation prompt; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 22 models tracked.

Top models

#ModelScore
1Grok 4.15.18
2GPT-45.14
3DeepSeek V3.25.08
4DeepSeek R15.02
5Gemini 2.5 Flash Lite5
6GPT-4o4.96
7Qwen 2.5 72B Instruct4.91
8Llama 3.3 70B Instruct4.78
9Qwen 3 32B (Non-reasoning)4.74
10Qwen 3 14B (Non-reasoning)4.73
11Qwen 2.5 32B Instruct4.69
12Qwen 2.5 14B Instruct4.51
13Qwen 3 8B (Non-reasoning)4.48
14Qwen 2.5 7B Instruct4.1
15Qwen 3 4B (Non-reasoning)4.07

Interactive version: theaggregate.ai/benchmark?slug=canmt · How It Works · Data refreshed daily, snapshot 2026-10-07.