PodBench - Thinking Mode: leaderboard

Metric: PodBench Score (0-100; mean of instruction following and script quality). Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1DeepSeek R1 052877.71
2Qwen 3 235B A22B (Thinking)77.37
3Qwen 3 32B (Thinking)76.85
4Qwen 3 14B (Reasoning)74.33
5Qwen 3 30B A3B (Thinking)72.33
6Qwen 3 8B (Thinking)71.17
7DeepSeek R1 0528 Qwen3 8B68.49
8Qwen 3 4B (Reasoning)67.1
9DeepSeek R1 Distill Qwen 32B64.09
10DeepSeek R1 Distill Llama 8B56.08
11Qwen 3 1.7B (Thinking)52.47
12DeepSeek-R1-Distill-Qwen-7B39.4

Interactive version: theaggregate.ai/benchmark?slug=podbench-thinking-mode · How It Works · Data refreshed daily, snapshot 2026-09-25.