DDR-Bench - MIMIC - Item-Averaged Trajectory-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1GPT-5.133.59
2Claude Sonnet 4.532.95
3GPT-5.230.49
4DeepSeek V3.228.29
5GPT-5 Mini26.36
6GLM-4.624.42
7MiniMax-M223.13
8Gemini 2.5 Flash22.22
9Qwen 3 Next 80B A3B Instruct20.8
10Gemini 3 Flash19.51
11Gemini 2.5 Pro18.48
12Gemini 2.5 Flash Lite17.18
13Qwen 3 4B 2507 Instruct17.18
14Qwen 2.5 72B Instruct15.5
15Qwen 2.5 14B Instruct13.44

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-mimic-item-averaged-trajectory-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.