JP-TL-Bench - Japanese to English - Easy: leaderboard
Metric: LT Score (0-10; Easy items only; anchored pairwise Bradley-Terry, gemini-2.5-flash judge). Source: arxiv.org. Saturation forecast: Around November 2026. 64 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 3 Flash (Preview) | 9.94 |
| 2 | Ministral-3-14B-Instruct-2512 | 9.9 |
| 3 | GPT-OSS-120B | 9.89 |
| 4 | Gemini 3 Pro (Preview) | 9.88 |
| 5 | DeepSeek V3.1 Terminus | 9.85 |
| 6 | Gemini 2.5 Flash | 9.83 |
| 7 | Qwen 3 235B A22B 2507 Instruct | 9.83 |
| 8 | Gemini 2.5 Pro | 9.79 |
| 9 | Kimi K2 0905 | 9.79 |
| 10 | Qwen 3 30B A3B 2507 Instruct | 9.7 |
| 11 | GPT-4o (2024-08-06) | 9.59 |
| 12 | Gemma 3 27B (IT) | 9.54 |
| 13 | NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 | 9.47 |
| 14 | Llama 3.1 405B Instruct | 9.05 |
| 15 | Ling-flash-2.0 | 8.85 |
Interactive version: theaggregate.ai/benchmark?slug=jp-tl-bench-japanese-to-english-easy · How It Works · Data refreshed daily, snapshot 2026-09-25.