DDR-Bench - GLOBEM - Item-Averaged Message-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1GLM-4.641.61
2Claude Sonnet 4.540.23
3GPT-5.238.39
4DeepSeek V3.238.16
5GPT-5.137.88
6MiniMax-M237.24
7GPT-5 Mini36.09
8Qwen 3 Next 80B A3B Instruct35.4
9Gemini 3 Flash35.29
10Gemini 2.5 Pro33.79
11Qwen2.5-7B-Instruct-1M29
12Gemini 2.5 Flash28.95
13Qwen2.5-14B-Instruct-1M28.8
14Qwen 2.5 72B Instruct28.74
15Qwen 2.5 7B Instruct27.36

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-globem-item-averaged-message-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.