Nejumi 4 - MT-Bench (Japanese) - Extraction: leaderboard

Metric: Judge rating (1-10, x10). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.6 (Thinking)99.5
2Claude Opus 4.5 (Thinking)99
3GLM-5.3 Flash (Max)99
4Claude Opus 4.1 (Thinking)99
5Claude Opus 4.8 (xHigh)99
6Claude Opus 5 (Max)98.5
7Claude Sonnet 4 (Non-reasoning)98.5
8Claude Opus 4 (Non-reasoning)98.5
9GPT-4.198
10Llama 3.1 405B Instruct FP898
11Kimi K3 (Max)98
12GLM-5.2 (Max)98
13GLM-5.3 (Max)98
14Gemini 3.1 Flash Lite (Preview)97.5
15Claude Sonnet 4 (Thinking)97.5

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-mt-bench-japanese-extraction · How It Works · Data refreshed daily, snapshot 2026-09-19.