DDR-Bench - MIMIC - Item-Averaged Message-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.534.37
2GPT-5 Mini28.81
3GPT-5.227.26
4DeepSeek V3.227
5GPT-5.126.61
6Gemini 3 Flash24.94
7MiniMax-M223.9
8GLM-4.623.26
9Gemini 2.5 Pro19.51
10Qwen 3 Next 80B A3B Instruct16.8
11Qwen 3 4B 2507 Instruct16.67
12Gemini 2.5 Flash Lite16.1
13Qwen2.5-14B-Instruct-1M15.5
14Gemini 2.5 Flash14.99
15Qwen 2.5 14B Instruct14.86

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-mimic-item-averaged-message-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.