GB/T-Bench - Diagnosis Recall - Terminology: leaderboard

Metric: Diagnosis recall (%; exact section, dimension and error-type match). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash25.97
2GPT-5.4 Mini25.4
3Claude Fable 524.77
4GPT-5.6 Sol22.94
5Qwen 3.7 Plus21.68
6GPT-5.320.15
7Qwen 3 235B A22B 2507 Instruct19.34
8GPT-5.519.09
9DeepSeek V4 Pro18.2
10Qwen 2.5 VL 72B Instruct18.2
11GPT-5.417.72
12DeepSeek V4 Flash16.26
13Claude Opus 4.813.19
14MiniMax-M2.711.97

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-diagnosis-recall-terminology · How It Works · Data refreshed daily, snapshot 2026-09-19.