Nejumi 4 - MT-Bench (Japanese) - Humanities: leaderboard

Metric: Judge rating (1-10, x10). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro100
2Qwen 3 235B A22B 2507 (Thinking)100
3Gemini 3.5 Flash100
4Gemini 3 Flash (Preview)100
5GPT-5 (High)100
6Gemini 3.6 Flash100
7GPT-5.1 (High)100
8GLM-5.2 (Max)100
9GPT-5.6 Terra (Max)100
10GLM-5.3 (Max)100
11Grok 4.20 0309 (Reasoning)100
12Claude Opus 5 (Max)100
13DeepSeek V4 Flash (Max)100
14llm-jp-4-32B-a3B (Thinking)100
15Qwen 3.5 27B (Thinking)100

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-mt-bench-japanese-humanities · How It Works · Data refreshed daily, snapshot 2026-09-19.