DDR-Bench - 10-K - Item-Averaged Message-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.577.27
2DeepSeek V3.260.66
3GLM-4.660.42
4GPT-5 Mini46.35
5Qwen 3 Next 80B A3B Instruct45.58
6GPT-5.244.99
7MiniMax-M244.66
8Gemini 3 Flash44.41
9Qwen 3 4B 2507 Instruct40.94
10GPT-5.137.69
11Qwen 2.5 72B Instruct27.56
12Qwen 2.5 32B Instruct27.53
13Gemini 2.5 Pro25.68
14Qwen2.5-14B-Instruct-1M23.56
15Gemini 2.5 Flash Lite19.32

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-10-k-item-averaged-message-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.