Deep20Bench — leaderboard

Metric: Questions to Solve (mean, lower is better). Source: mindalyze-com.github.io. 11 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)12.34
2Kimi K3 (High)12.74
3GPT-OSS-120B (High)13.63
4GPT-5.6 Sol (High)14.4
5Claude Sonnet 5 (High)14.74
6Grok 4.5 (High)15.17
7GPT-5 Nano (Medium)15.49
8Gemini 3.6 Flash (High)16.89
9GPT-5.6 Luna (High)17.74
10Mistral Medium 3.5 (High)20.06
11Llama 4 Maverick32.23

Interactive version: theaggregate.ai/benchmark?slug=deep20bench · How It Works · Data refreshed daily, snapshot 2026-08-05.