PodBench: leaderboard

Metric: PodBench Score (0-100; mean of instruction following and script quality). Source: arxiv.org. Saturation forecast: Around October 2026. 19 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)79.97
2Claude Sonnet 4.579.91
3DeepSeek V3 (0324)76.16
4Qwen 3 235B A22B (Non-reasoning)76.02
5Qwen 3 32B (Non-reasoning)73.54
6GPT-4o73.15
7Qwen 3 14B (Non-reasoning)69.65
8Qwen 3 30B A3B (Non-reasoning)69.39
9Qwen 2.5 72B Instruct66.19
10Qwen 3 8B (Non-reasoning)65.36
11Qwen 2.5 32B Instruct62.35
12Qwen 3 4B (Non-reasoning)62.21
13InternLM3-8B-Instruct59.92
14Llama 4 Scout Instruct57.33
15Qwen 2.5 7B Instruct56.55

Interactive version: theaggregate.ai/benchmark?slug=podbench · How It Works · Data refreshed daily, snapshot 2026-09-25.