GB/T-Bench - Diagnosis Recall - Normative References: leaderboard

Metric: Diagnosis recall (%; exact section, dimension and error-type match). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Qwen 2.5 VL 72B Instruct60.4
2GPT-5.4 Mini48.28
3GPT-5.543.89
4Qwen 3 235B A22B 2507 Instruct43.47
5DeepSeek V4 Flash43.16
6Claude Fable 542.86
7Qwen 3.7 Plus42.84
8GPT-5.439.6
9DeepSeek V4 Pro39.39
10Gemini 3.5 Flash38.35
11Claude Opus 4.836.57
12GPT-5.6 Sol34.07
13GPT-5.333.02
14MiniMax-M2.731.77

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-diagnosis-recall-normative-references · How It Works · Data refreshed daily, snapshot 2026-09-19.