GB/T-Bench - Diagnosis Recall - Scope Consistency: leaderboard

Metric: Diagnosis recall (%; exact section, dimension and error-type match). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.581.81
2GPT-5.6 Sol75.96
3Claude Fable 570.87
4GPT-5.469.65
5Qwen 3.7 Plus67
6Gemini 3.5 Flash60.88
7DeepSeek V4 Pro60.33
8GPT-5.354.3
9DeepSeek V4 Flash53.38
10GPT-5.4 Mini43.33
11Claude Opus 4.841.96
12Qwen 2.5 VL 72B Instruct38.39
13Qwen 3 235B A22B 2507 Instruct36.11
14MiniMax-M2.733.46

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-diagnosis-recall-scope-consistency · How It Works · Data refreshed daily, snapshot 2026-09-19.