VisualPuzzles — leaderboard

Multimodal reasoning benchmark testing visual puzzle-solving without relying on object recognition. Evaluates spatial reasoning, pattern completion, and logical deduction on visual inputs.

Metric: Overall Accuracy (%). Source: neulab.github.io. Status: saturation imminent. 36 models tracked.

Top models

#ModelScore
1Human Expert89.3
2Median Human75
3O4 Mini57
4O354
5Gemini 3 Pro (Preview)52.7
6O151.8
7Gemini 2.5 Pro49.5
8Claude 3.7 Sonnet48.3
9Claude 3.7 Sonnet (Thinking)48.2
10Claude Sonnet 4 (Thinking)47.3
11Gemini 1.5 Pro45
12Gemini 2.0 Flash44.9
13Gemini 2.5 Flash (Thinking)44.6
14Claude 3.5 Sonnet42.4
15Gemini 2.0 Flash (Thinking)42.2

Interactive version: theaggregate.ai/benchmark?slug=visualpuzzles · How the rankings work · Data refreshed daily, snapshot 2026-07-22.