GB/T-Bench - Diagnosis Recall - Document Structure: leaderboard

Metric: Diagnosis recall (%; exact section, dimension and error-type match). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol75.81
2GPT-5.571.94
3Claude Fable 565.08
4GPT-5.455.87
5Qwen 3.7 Plus54.41
6DeepSeek V4 Pro50.33
7Gemini 3.5 Flash49.87
8GPT-5.348.26
9DeepSeek V4 Flash41.81
10Claude Opus 4.835.57
11GPT-5.4 Mini31.99
12MiniMax-M2.729.22
13Qwen 2.5 VL 72B Instruct25.34
14Qwen 3 235B A22B 2507 Instruct24.74

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-diagnosis-recall-document-structure · How It Works · Data refreshed daily, snapshot 2026-09-19.