GB/T-Bench - Diagnosis Recall - Normative Modality: leaderboard

Metric: Diagnosis recall (%; exact section, dimension and error-type match). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.541.66
2Claude Fable 541.62
3GPT-5.6 Sol41.5
4Qwen 3.7 Plus33.84
5GPT-5.432.61
6Gemini 3.5 Flash31.58
7DeepSeek V4 Pro31.14
8GPT-5.325.97
9DeepSeek V4 Flash24.45
10Claude Opus 4.821.84
11MiniMax-M2.721.64
12GPT-5.4 Mini16.97
13Qwen 3 235B A22B 2507 Instruct15.89
14Qwen 2.5 VL 72B Instruct13.23

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-diagnosis-recall-normative-modality · How It Works · Data refreshed daily, snapshot 2026-09-19.