PlanningBench: leaderboard

Metric: All-pass (%) (self-reported). Source: benchmarklist.com. 18 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)63.17
2GPT-5.4 (High)58.56
3GPT-5.4 (Medium)58.09
4Seed 2.0 Pro (High)44.33
5DeepSeek V3.2 (Thinking)37.13
6Hy3-preview36.17
7Qwen 3.5 Plus (Thinking)34.03
8DeepSeek R133.07
9Gemini 2.5 Pro31.7
10DeepSeek V3.2 Exp29.27
11Seed 1.822.4
12Qwen 3 32B0.27
13Qwen 3 8B0
14Qwen 3 14B0

Interactive version: theaggregate.ai/benchmark?slug=planningbench · How It Works · Data refreshed daily, snapshot 2026-09-05.