DDR-Bench - Overall: leaderboard

Metric: Mean Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.547.73
2DeepSeek V3.238.8
3GLM-4.637.52
4GPT-5.237.09
5GPT-5.136.27
6GPT-5 Mini34.61
7MiniMax-M232.25
8Gemini 3 Flash30.65
9Qwen 3 Next 80B A3B Instruct30.56
10Gemini 2.5 Pro25
11Qwen 3 4B 2507 Instruct24.97
12Qwen 2.5 72B Instruct21.08
13Gemini 2.5 Flash20.17
14Qwen2.5-14B-Instruct-1M19.23
15Qwen 2.5 32B Instruct19.06

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.