PodBench - Script Quality: leaderboard

Metric: Podcast Script Quality (0-100 rubric: depth 45, structure 30, language 25). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)63.85
2Claude Sonnet 4.563.25
3DeepSeek V3 (0324)59.61
4Qwen 3 235B A22B (Non-reasoning)58.39
5GPT-4o56.86
6Qwen 3 32B (Non-reasoning)56.39
7Qwen 3 30B A3B (Non-reasoning)52.28
8Qwen 3 14B (Non-reasoning)52.22
9Qwen 3 8B (Non-reasoning)49.93
10Qwen 2.5 72B Instruct49.06
11Qwen 3 4B (Non-reasoning)47.69
12Qwen 2.5 32B Instruct46.85
13InternLM3-8B-Instruct45.89
14Llama 4 Scout Instruct44.51
15Qwen 2.5 7B Instruct43.96

Interactive version: theaggregate.ai/benchmark?slug=podbench-script-quality · How It Works · Data refreshed daily, snapshot 2026-09-25.