HANDBOOK.md Agents: leaderboard

Metric: Score (%). Source: surgehq.ai. 58 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Adaptive Reasoning, Max Effort)36.2
2Claude Fable 534.2
3Claude Opus 5 (Adaptive Reasoning, Max Effort)32.3
4Claude Opus 529.6
5Grok 4.6 (xHigh)27.3
6DeepSeek V4 Pro (Max)26.9
7Grok 4.625.8
8GPT-5.6 Sol (Max)23.5
9Claude Opus 4.8 (Adaptive Reasoning, Max Effort)21.9
10GPT-5.521.5
11GPT-5.6 Sol21.5
12GPT-5.5 (xHigh)21.5
13DeepSeek V4 Pro19.6
14Claude Opus 4.818.9
15Qwen 3.8 Max16.5

Interactive version: theaggregate.ai/benchmark?slug=handbook-md-agents · How It Works · Data refreshed daily, snapshot 2026-09-05.