Nejumi 4 - MT-Bench (Japanese) - Roleplay: leaderboard

Metric: Judge rating (1-10, x10). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Kimi K3 (Max)100
2Claude Opus 5 (Max)100
3Gemini 3.6 Flash99.5
4Claude Opus 4.5 (Thinking)99.5
5GLM-5.3 (Max)99.5
6Claude Opus 4.6 (Thinking)99.5
7Qwen 3.6 Max (Preview) (Thinking)99.5
8Solar Pro 499
9Claude Opus 4.5 (Non-reasoning)99
10Claude Sonnet 4.6 (Thinking)99
11GLM-5.3 Flash (Max)99
12GPT-OSS-Swallow-120B-RL-v0.1 (Thinking)99
13Claude Opus 4.8 (xHigh)99
14MiniMax M3 (Thinking)99
15Gemini 2.5 Pro98.5

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-mt-bench-japanese-roleplay · How It Works · Data refreshed daily, snapshot 2026-09-19.