GB/T-Bench - Direct Review Diagnosis Recall: leaderboard

Metric: Diagnosis recall (%; exact section, dimension and error-type match). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol52.03
2GPT-5.550.52
3Claude Fable 549.93
4Qwen 3.7 Plus43.51
5GPT-5.442.87
6Gemini 3.5 Flash40.87
7DeepSeek V4 Pro39.61
8GPT-5.336.2
9DeepSeek V4 Flash34.56
10GPT-5.4 Mini30.52
11Claude Opus 4.829.04
12Qwen 2.5 VL 72B Instruct27.31
13Qwen 3 235B A22B 2507 Instruct25.51
14MiniMax-M2.725.16

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-direct-review-diagnosis-recall · How It Works · Data refreshed daily, snapshot 2026-09-19.