ObviousBench: leaderboard

Metric: Answer pass³ (%). Source: benchmarklist.com. 506 models tracked.

Top models

#ModelScore
1Qwen 3.5 27B100
2GPT-5 (High)100
3GPT-5.5 (xHigh)100
4Gemini 3.5 Flash (High)100
5Grok 4.5 (High)100
6GPT-5 (Medium)100
7Gemini 3.1 Pro (Preview) (High)100
8Grok 4.6 (High)100
9GPT-5.5 (Medium)100
10Claude Opus 5 (High)100
11Hy3 (High)100
12Grok 4.6 (Medium)100
13Gemini 3.1 Pro (Preview) (Medium)100
14Qwen 3.5 397B A17B99.31
15Gemini 3.5 Flash99.31

Interactive version: theaggregate.ai/benchmark?slug=obviousbench · How It Works · Data refreshed daily, snapshot 2026-09-19.