DDR-Bench - 10-K - Item-Averaged Trajectory-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.561.25
2GPT-5.144.76
3GPT-5.241.22
4DeepSeek V3.238.16
5GPT-5 Mini36.77
6GLM-4.636.16
7Qwen 3 Next 80B A3B Instruct31.1
8MiniMax-M226.82
9Gemini 3 Flash21.08
10Qwen 3 4B 2507 Instruct19.91
11Gemini 2.5 Flash16.49
12Gemini 2.5 Pro16.14
13Qwen 2.5 72B Instruct14.02
14Qwen 2.5 14B Instruct10.12
15Qwen2.5-14B-Instruct-1M9.78

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-10-k-item-averaged-trajectory-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.