CMDB-1500 (Text): leaderboard

Metric: Accuracy (%), fixed denominator of 1,200 questions (invalid answers count as wrong), effort as labelled. Source: surdai.com. Saturation forecast: Around June 2027. 10 models tracked.

Top models

#ModelScore
1GPT-6.1 Sol (Low)80
2GPT-6 Luna (Low)76.58
3GLM-5.3 Flash (Low)75.75
4Qwen 3.8 Flash71.08
5Kimi K2.671
6DeepSeek V4.1 Flash68.58

Interactive version: theaggregate.ai/benchmark?slug=cmdb-1500-text · How It Works · Data refreshed daily, snapshot 2026-10-07.