DDR-Bench - GLOBEM - Sample-Averaged Trajectory-Wise: leaderboard

Metric: Checklist Coverage Accuracy (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.538.72
2DeepSeek V3.238.46
3GPT-5.238.15
4GLM-4.637.6
5MiniMax-M236.81
6Gemini 3 Flash36.74
7GPT-5.135.79
8Gemini 2.5 Pro35.62
9Qwen 3 Next 80B A3B Instruct33.06
10GPT-5 Mini31.54
11Gemini 2.5 Flash28.44
12Qwen 3 4B 2507 Instruct27.55
13Qwen 2.5 14B Instruct26.47
14Qwen 2.5 32B Instruct25.88
15Qwen2.5-7B-Instruct-1M25.68

Interactive version: theaggregate.ai/benchmark?slug=ddr-bench-globem-sample-averaged-trajectory-wise · How It Works · Data refreshed daily, snapshot 2026-09-19.