ZEROBench-Sub — leaderboard

ZEROBench-Sub — the public subquestion subset of ZeroBench, extremely difficult visual reasoning puzzles over images; models answer the decomposed subquestions of each visual task.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 40 models tracked.

Top models

#ModelScore
1O4 Mini29.05
2GPT-5 Mini (High)27.79
3GPT-4.527.01
4GPT-5 (Medium)26.19
5Gemini 2.5 Pro26.04
6O325.51
7Claude 3.5 Sonnet25.5
8Claude Opus 4.125.3
9Claude Opus 425.06
10Gemini 2.5 Flash24.48
11Llama 4 Maverick23.72
12Gemini 2.0 Flash23.24
13Claude Sonnet 423.01
14O1 Pro22.4
15GPT-5 Nano (High)21.65

Interactive version: theaggregate.ai/benchmark?slug=zerobench-sub · How the rankings work · Data refreshed daily, snapshot 2026-07-22.