Swallow - Japanese MT-Bench - Writing: leaderboard

Metric: Judge Score (normalized, %). Source: swallow-llm.github.io. 68 models tracked.

Top models

#ModelScore
1GPT-5.4 (Medium)80.4
2GPT-5 (Medium)78.1
3GPT-5 Mini (Medium)77.7
4Gemma 4 31B (IT) (Thinking)74.8
5O3 (2025-04-16) (Medium)74.7
6gemma-4-26B-A4B-it (Thinking)74.5
7GPT-4.172.5
8Qwen 3 235B A22B 2507 Instruct71.7
9GPT-OSS-Swallow-120B-RL-v0.1 (Thinking)70.7
10Qwen 3.5 27B (Thinking)70.2
11Gemma 4 E4B (IT) (Thinking)69.7
12O3 Mini (Medium)69.4
13Gemma 4 E2B (IT) (Thinking)69.2
14Qwen 3 235B A22B 2507 (Thinking)68.5
15GPT-OSS-120B (Medium)68

Interactive version: theaggregate.ai/benchmark?slug=swallow-japanese-mt-bench-writing · How It Works · Data refreshed daily, snapshot 2026-09-19.