Deep20Bench - Edition 1.1: leaderboard
Metric: Question score: subject-mean counted questions including model-failure penalty (lower is better). Source: mindalyze-com.github.io. Saturation forecast: Around 2028. 18 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-6 Astra (High) | 13.67 |
| 2 | Gemini 3.8 Flash (High) | 14.87 |
| 3 | Claude Opus 5.5 (High) | 15 |
| 4 | Claude Fable 5.1 (High) | 15.1 |
| 5 | GPT-6.1 Sol (High) | 15.23 |
| 6 | Gemini 3.7 Flash (High) | 16.57 |
| 7 | Grok 4.6 (High) | 17.13 |
| 8 | Claude Sonnet 5.5 (High) | 17.83 |
| 9 | GPT-6 Sol (High) | 18.03 |
| 10 | Claude Opus 5 (High) | 18.07 |
| 11 | GPT-5.6 Sol (High) | 18.07 |
| 12 | GPT-5.6 Luna (High) | 21.03 |
| 13 | GPT-6 Luna (High) | 21.17 |
| 14 | GPT-OSS-120B (High) | 22.23 |
| 15 | Grok 4.7 (High) | 22.23 |
Interactive version: theaggregate.ai/benchmark?slug=deep20bench-edition-1-1 · How It Works · Data refreshed daily, snapshot 2026-10-09.