Humanity's Sixth Sense: leaderboard

Metric: Pass@1 (%), all rubric criteria; three attempts/task. Source: scale.com. Saturation forecast: Around 2029. 25 models tracked.

Top models

#ModelScore
1GPT-6 Astra (Max)53.6
2GPT-6.1 Sol (Max)46.6
3Claude Opus 5.5 (xHigh)44.6
4Gemini 3.8 Flash (High)41.6
5Claude Fable 5.140.8
6Gemini 3.7 Flash (High)39.8
7Muse Spark 1.3 (Max)37.4
8Claude Fable 5 (Max)34.5
9Qwen 3.8 Max (Max)33
10Gemini 3.5 Flash (High)32.6
11Gemini 3.6 Flash (High)31.9
12GPT-6 Sol (Max)31.2
13Qwen 3.8 Flash (Max)30.9
14Claude Opus 5 (Max)30.5
15GPT-5.6 Sol (Max)30

Interactive version: theaggregate.ai/benchmark?slug=humanity-s-sixth-sense · How It Works · Data refreshed daily, snapshot 2026-10-09.