The Aggregate - Day-one Recall Check: leaderboard

Metric: Accuracy (%). Source: theaggregate.ai. Saturation forecast: Around June 2027. 33 models tracked.

Top models

#ModelScoreOverall rank
1Claude Fable 561.8#13
2Claude Opus 558.8#11
3Claude Fable 5.155.9#8
4GPT-5.547.1#26
5Claude Opus 4.841.2#33
6GPT-5.438.2#76
7GPT-5.238.2#105
8DeepSeek V4 Pro32.4#96
9Kimi K2.632.4#99
10Nemotron 3 Ultra32.3#234
11GPT-5.4 Mini29.4#202
12Qwen 3.6 35B A3B29.4#214
13Nemotron 3 Super26.5#327
14Qwen 3.6 Plus23.5#113
15Kimi K2 090523.5#282

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #9 GPT-6.1 Sol.

Interactive version: theaggregate.ai/benchmark?slug=the-aggregate-day-one-recall-check · How It Works · Data refreshed daily, snapshot 2026-10-11.