DDR-Bench - MIMIC - Sample-Averaged Message-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.536.07
2GPT-5 Mini30.02
3DeepSeek V3.228.98
4GPT-5.228.85
5GPT-5.128.37
6Gemini 3 Flash26.58
7MiniMax-M225.39
8GLM-4.625.03
9Gemini 2.5 Pro21.51
10Qwen 3 Next 80B A3B Instruct18.01
11Qwen 3 4B 2507 Instruct17.97
12Gemini 2.5 Flash Lite17.19
13Qwen2.5-14B-Instruct-1M16.75
14Gemini 2.5 Flash16.64
15Qwen 2.5 14B Instruct15.93

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-mimic-sample-averaged-message-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.