Swallow - Japanese MT-Bench - Extraction: leaderboard

Metric: Judge Score (normalized, %). Source: swallow-llm.github.io. 68 models tracked.

Top models

#ModelScore
1GPT-5.4 (Medium)78.7
2GPT-4o (2024-08-06)77.6
3O3 Mini (Medium)77.4
4gemma-4-26B-A4B-it (Thinking)77.2
5GPT-5 Mini (Medium)77
6Qwen 3 32B (Thinking)76.5
7Gemma 3 27B (IT)76.4
8O3 (2025-04-16) (Medium)76.4
9GPT-OSS-Swallow-120B-RL-v0.1 (Thinking)76.3
10GPT-5 (Medium)75.8
11GPT-4.175.7
12Gemma 4 31B (IT) (Thinking)75.7
13llm-jp-4-32B-a3B (Thinking)75
14GPT-OSS-20B (Medium)74.9
15Qwen 3.5 27B (Thinking)74.8

Interactive version: theaggregate.ai/benchmark?slug=swallow-japanese-mt-bench-extraction · How It Works · Data refreshed daily, snapshot 2026-09-19.