Swallow - English MT-Bench - STEM: leaderboard

Metric: Judge Score (normalized, %). Source: swallow-llm.github.io. 68 models tracked.

Top models

#ModelScore
1GPT-5 (Medium)86.4
2GPT-5 Mini (Medium)84.9
3GPT-5.4 (Medium)83.3
4O3 (2025-04-16) (Medium)82.5
5Qwen 3.5 122B A10B (Thinking)80.8
6Gemma 4 31B (IT) (Thinking)80.6
7Qwen 3.5 35B A3B (Thinking)79.6
8Qwen 3.5 27B (Thinking)79.1
9Qwen 3 235B A22B 2507 Instruct79
10O3 Mini (Medium)79
11gemma-4-26B-A4B-it (Thinking)77.9
12GPT-4.176.2
13Qwen 3 Next 80B A3B Instruct75.8
14Qwen 3 Next 80B A3B (Thinking)75.5
15GPT-OSS-Swallow-120B-RL-v0.1 (Thinking)75.4

Interactive version: theaggregate.ai/benchmark?slug=swallow-english-mt-bench-stem · How It Works · Data refreshed daily, snapshot 2026-09-19.