Deep20Bench - Edition 1.1: leaderboard

Metric: Question score: subject-mean counted questions including model-failure penalty (lower is better). Source: mindalyze-com.github.io. Saturation forecast: Around 2028. 18 models tracked.

Top models

#ModelScore
1GPT-6 Astra (High)13.67
2Gemini 3.8 Flash (High)14.87
3Claude Opus 5.5 (High)15
4Claude Fable 5.1 (High)15.1
5GPT-6.1 Sol (High)15.23
6Gemini 3.7 Flash (High)16.57
7Grok 4.6 (High)17.13
8Claude Sonnet 5.5 (High)17.83
9GPT-6 Sol (High)18.03
10Claude Opus 5 (High)18.07
11GPT-5.6 Sol (High)18.07
12GPT-5.6 Luna (High)21.03
13GPT-6 Luna (High)21.17
14GPT-OSS-120B (High)22.23
15Grok 4.7 (High)22.23

Interactive version: theaggregate.ai/benchmark?slug=deep20bench-edition-1-1 · How It Works · Data refreshed daily, snapshot 2026-10-09.