DDR-Bench - GLOBEM - Item-Averaged Trajectory-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.538.85
2DeepSeek V3.238.62
3GPT-5.238.39
4GLM-4.637.7
5Gemini 3 Flash36.78
6MiniMax-M236.55
7GPT-5.135.63
8Gemini 2.5 Pro35.4
9Qwen 3 Next 80B A3B Instruct32.87
10GPT-5 Mini31.72
11Gemini 2.5 Flash28.28
12Qwen 3 4B 2507 Instruct27.59
13Qwen 2.5 14B Instruct26.67
14Qwen 2.5 32B Instruct25.98
15Qwen 2.5 72B Instruct25.52

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-globem-item-averaged-trajectory-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.