Nejumi 4 - MT-Bench (Japanese) - Writing: leaderboard

Metric: Judge rating (1-10, x10). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite (Preview)99.5
2Claude Sonnet 4.6 (Thinking)99.5
3Kimi K3 (Thinking)99.5
4Qwen 3.6 Max (Preview) (Thinking)99
5GPT-5 (High)98.5
6GPT-5.5 (xHigh)98.5
7DeepSeek V3.2 (Thinking)98.5
8GPT-5.1 (High)98.5
9GPT-5.4 (xHigh)98.5
10GPT-5.6 Luna (Max)98.5
11Claude Opus 4.6 (Thinking)98.5
12Claude Opus 4.7 (xHigh)98.5
13GPT-4.198
14Gemini 3.5 Flash98
15Gemini 3.6 Flash98

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-mt-bench-japanese-writing · How It Works · Data refreshed daily, snapshot 2026-09-19.