BabyVision: leaderboard

Visual reasoning tasks that 3-year-old children can solve - fine-grained discrimination, visual tracking, spatial perception, and pattern recognition. 388 questions across 22 subtypes. Human baseline: 94.1%.

Metric: Score (%). Source: unipat.ai. Status: years away from saturation. 29 models tracked.

Top models

#ModelScore
1Median Human94.1
2GPT-5.6 Sol88.9
3Kimi K385.7
4Qwen 3.8 27B85.6
5GPT-5.583.6
6Qwen 3.8 Max82
7Claude Opus 4.881.2
8Muse Spark 1.176.3
9Seed 2.1 Pro73.7
10Qwen 3.7 Plus70.4
11Kimi K2.668.5
12Seed 2.1 Turbo62.9
13Seed 2.0 Pro (High)60.6
14GLM-5.3 Flash53.4
15Gemini 3.1 Pro (Preview)51.6

Interactive version: theaggregate.ai/benchmark?slug=babyvision · How It Works · Data refreshed daily, snapshot 2026-09-05.