DDR-Bench - MIMIC - Sample-Averaged Trajectory-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1GPT-5.135.24
2Claude Sonnet 4.534.67
3GPT-5.232.49
4DeepSeek V3.230.57
5GPT-5 Mini27.86
6GLM-4.626.15
7MiniMax-M224.36
8Gemini 2.5 Flash23.76
9Qwen 3 Next 80B A3B Instruct21.79
10Gemini 3 Flash20.78
11Gemini 2.5 Pro20
12Qwen 3 4B 2507 Instruct18.68
13Gemini 2.5 Flash Lite17.96
14Qwen 2.5 72B Instruct16.82
15Qwen 2.5 14B Instruct14.51

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-mimic-sample-averaged-trajectory-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.