DDR-Bench - GLOBEM - Sample-Averaged Message-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1GLM-4.641.56
2Claude Sonnet 4.540.13
3GPT-5.238.81
4DeepSeek V3.238.46
5GPT-5.138.31
6MiniMax-M237.07
7GPT-5 Mini35.86
8Qwen 3 Next 80B A3B Instruct35.75
9Gemini 3 Flash35.6
10Gemini 2.5 Pro33.77
11Qwen2.5-7B-Instruct-1M29.34
12Gemini 2.5 Flash29.06
13Qwen 2.5 72B Instruct28.83
14Qwen2.5-14B-Instruct-1M28.75
15Qwen 2.5 7B Instruct27.2

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-globem-sample-averaged-message-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.