DDR-Bench - 10-K - Sample-Averaged Message-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.577.61
2GLM-4.660.31
3DeepSeek V3.260.08
4GPT-5 Mini46.82
5GPT-5.244.89
6Gemini 3 Flash44.82
7Qwen 3 Next 80B A3B Instruct44.76
8MiniMax-M244.17
9Qwen 3 4B 2507 Instruct41.13
10GPT-5.137.12
11Qwen 2.5 72B Instruct27.13
12Qwen 2.5 32B Instruct27.07
13Gemini 2.5 Pro24.48
14Qwen2.5-14B-Instruct-1M22.69
15Gemini 2.5 Flash Lite19.45

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-10-k-sample-averaged-message-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.