PodBench - Instruction Following: leaderboard

Metric: Instruction Following (0-100; judge-derived checklist, items scored 0/0.5/1). Source: arxiv.org. Saturation forecast: Around October 2026. 19 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.596.58
2Gemini 3 Pro (Preview)96.09
3Qwen 3 235B A22B (Non-reasoning)93.64
4DeepSeek V3 (0324)92.71
5Qwen 3 32B (Non-reasoning)90.69
6GPT-4o89.43
7Qwen 3 14B (Non-reasoning)87.07
8Qwen 3 30B A3B (Non-reasoning)86.5
9Qwen 2.5 72B Instruct83.31
10Qwen 3 8B (Non-reasoning)80.79
11Qwen 2.5 32B Instruct77.84
12Qwen 3 4B (Non-reasoning)76.73
13InternLM3-8B-Instruct73.95
14Llama 4 Scout Instruct70.14
15Qwen 2.5 7B Instruct69.13

Interactive version: theaggregate.ai/benchmark?slug=podbench-instruction-following · How It Works · Data refreshed daily, snapshot 2026-09-25.