Deep20Bench: leaderboard

Metric: Questions to Solve (mean, lower is better). Source: mindalyze-com.github.io. 18 models tracked.

Top models

#ModelScore
1Claude Fable 5 (High)12.06
2Claude Fable 5.1 (High)12.11
3Claude Opus 5 (High)12.34
4Kimi K3 (High)12.74
5Gemini 3.8 Flash (High)13.14
6GPT-OSS-120B (High)13.63
7Gemini 3.7 Flash (High)14.03
8Grok 4.6 (High)14.29
9GPT-5.6 Sol (High)14.4
10Claude Sonnet 5 (High)14.74
11GPT-6 (High)15.09
12Grok 4.5 (High)15.17
13GPT-5 Nano (Medium)15.49
14Gemini 3.6 Flash (High)16.89
15GLM-5.3 Flash (High)17.6

Interactive version: theaggregate.ai/benchmark?slug=deep20bench · How It Works · Data refreshed daily, snapshot 2026-09-19.