The Aggregate - Long-tail Book Recall: leaderboard
Metric: Accuracy (%). Source: theaggregate.ai. Saturation forecast: Around September 2027. 18 models tracked.
Top models
| # | Model | Score | Overall rank |
|---|---|---|---|
| 1 | Claude Fable 5.1 (High) | 69.5 | #8 (Claude Fable 5.1) |
| 2 | Claude Fable 5 (High) | 69.1 | #13 (Claude Fable 5) |
| 3 | Claude Opus 5 (High) | 62.8 | #11 (Claude Opus 5) |
| 4 | Gemini 3.7 Flash (High) | 56.7 | #20 (Gemini 3.7 Flash) |
| 5 | GPT-5.6 Sol (High) | 55.3 | #16 (GPT-5.6 Sol) |
| 6 | GPT-6 Astra (High) | 50.7 | #5 (GPT-6 Astra) |
| 7 | GPT-5.4 (High) | 46.1 | #76 (GPT-5.4) |
| 8 | DeepSeek V4 Pro (High) | 44 | #96 (DeepSeek V4 Pro) |
| 9 | Claude Opus 4.8 (High) | 42.2 | #33 (Claude Opus 4.8) |
| 10 | Muse Spark 1.3 (High) | 39.4 | #22 (Muse Spark 1.3) |
| 11 | GPT-5.4 Mini (High) | 38.3 | #202 (GPT-5.4 Mini) |
| 12 | GPT-5.2 (High) | 37.2 | #105 (GPT-5.2) |
| 13 | Qwen 3.6 Plus (High) | 31.9 | #113 (Qwen 3.6 Plus) |
| 14 | Kimi K2.6 (High) | 30.5 | #99 (Kimi K2.6) |
| 15 | GPT-OSS-120B (High) | 17.4 | #330 (GPT-OSS-120B) |
No result here: #3 Claude Opus 5.5, #9 GPT-6.1 Sol, #10 Claude Sonnet 5.5.
Interactive version: theaggregate.ai/benchmark?slug=the-aggregate-long-tail-book-recall · How It Works · Data refreshed daily, snapshot 2026-10-11.