JP-TL-Bench - Japanese to English - Hard: leaderboard

Metric: LT Score (0-10; Hard items only; anchored pairwise Bradley-Terry, gemini-2.5-flash judge). Source: arxiv.org. Saturation forecast: Around November 2026. 64 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro9.99
2Gemini 3 Flash (Preview)9.99
3Gemini 3 Pro (Preview)9.98
4Qwen 3 235B A22B 2507 Instruct9.97
5GPT-OSS-120B9.95
6DeepSeek V3.1 Terminus9.93
7Kimi K2 09059.92
8Ministral-3-14B-Instruct-25129.89
9Gemini 2.5 Flash9.88
10Qwen 3 30B A3B 2507 Instruct9.84
11Gemma 3 27B (IT)9.77
12GPT-4o (2024-08-06)9.74
13Ling-flash-2.09.19
14ABEJA-Qwen2.5-32B-Japanese-v1.09.08
15ELYZA-Shortcut-1.0-Qwen-32B8.94

Interactive version: theaggregate.ai/benchmark?slug=jp-tl-bench-japanese-to-english-hard · How It Works · Data refreshed daily, snapshot 2026-09-25.