DDR-Bench - 10-K - Sample-Averaged Trajectory-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.560.58
2GPT-5.144.25
3GPT-5.241.09
4DeepSeek V3.238.15
5GPT-5 Mini37.12
6GLM-4.636.02
7Qwen 3 Next 80B A3B Instruct30.82
8MiniMax-M226.88
9Gemini 3 Flash21.24
10Qwen 3 4B 2507 Instruct19.76
11Gemini 2.5 Flash16.06
12Gemini 2.5 Pro15.57
13Qwen 2.5 72B Instruct13.42
14Qwen 2.5 14B Instruct10.6
15Qwen2.5-14B-Instruct-1M10.13

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-10-k-sample-averaged-trajectory-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.