GB/T-Bench - Direct Review DMTR@8: leaderboard

Metric: Documents with at least 8 correct diagnoses (%). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol54.35
2GPT-5.554.1
3Claude Fable 547.83
4GPT-5.438.73
5Qwen 3.7 Plus34.43
6Gemini 3.5 Flash30.12
7Claude Opus 4.823.57
8DeepSeek V4 Pro21.93
9GPT-5.318.44
10Qwen 3 235B A22B 2507 Instruct14.96
11DeepSeek V4 Flash14.55
12GPT-5.4 Mini10.25
13Qwen 2.5 VL 72B Instruct8.2
14MiniMax-M2.76.56

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-direct-review-dmtr-8 · How It Works · Data refreshed daily, snapshot 2026-09-19.