GB/T-Bench - Direct Review DMTR@9: leaderboard

Metric: Documents with at least 9 correct diagnoses (%). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.539.34
2GPT-5.6 Sol36.96
3Claude Fable 532.61
4GPT-5.425
5Qwen 3.7 Plus18.85
6Gemini 3.5 Flash17.21
7Claude Opus 4.814.34
8DeepSeek V4 Pro12.3
9GPT-5.38.81
10Qwen 3 235B A22B 2507 Instruct8.2
11DeepSeek V4 Flash7.38
12GPT-5.4 Mini3.89
13MiniMax-M2.72.87
14Qwen 2.5 VL 72B Instruct2.46

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-direct-review-dmtr-9 · How It Works · Data refreshed daily, snapshot 2026-09-19.