GB/T-Bench - Direct Review DMTR@10: leaderboard

Metric: Documents with at least 10 correct diagnoses (%). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Claude Fable 526.09
2GPT-5.524.39
3GPT-5.6 Sol21.74
4GPT-5.411.89
5Qwen 3.7 Plus9.43
6Gemini 3.5 Flash8.2
7Claude Opus 4.87.17
8DeepSeek V4 Pro4.92
9Qwen 3 235B A22B 2507 Instruct4.71
10DeepSeek V4 Flash3.07
11GPT-5.32.66
12GPT-5.4 Mini1.43
13MiniMax-M2.71.02
14Qwen 2.5 VL 72B Instruct0.82

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-direct-review-dmtr-10 · How It Works · Data refreshed daily, snapshot 2026-09-19.