GB/T-Bench - Direct Review CMCS: leaderboard

Metric: CMCS (0-1; coverage with missed and redundant diagnosis penalties). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol0.33
2GPT-5.50.32
3Claude Fable 50.32
4Qwen 3.7 Plus0.26
5GPT-5.40.26
6Gemini 3.5 Flash0.24
7DeepSeek V4 Pro0.23
8GPT-5.30.2
9DeepSeek V4 Flash0.19
10Claude Opus 4.80.17
11GPT-5.4 Mini0.16
12Qwen 3 235B A22B 2507 Instruct0.14
13Qwen 2.5 VL 72B Instruct0.14
14MiniMax-M2.70.13

Interactive version: theaggregate.ai/benchmark?slug=gb-t-bench-direct-review-cmcs · How It Works · Data refreshed daily, snapshot 2026-09-19.