ARC-AGI-1: leaderboard

800 grid puzzles (400 train, 400 eval) from François Chollet (2019): infer a rule from about three input-output grids and draw the output for a new input; o3-preview scored 75-87% in Dec 2024.

Metric: Accuracy (%). Source: arcprize.org. Status: saturated. 223 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)98.5
2GPT-6 (xHigh)98.5
3GPT-6 (High)98.5
4Gemini 3.1 Pro (Preview)98
5Claude Opus 5 (Max)97.5
6GPT-5.6 Sol (xHigh)97.5
7Claude Fable 5.1 (Max)97.5
8Claude Opus 5 (High)97.5
9GPT-6 (Max)97.5
10GPT-6 (Medium)97.5
11GPT-5.6 Sol (High)97
12GPT-5.6 Sol (Max)96.5
13GPT-5.6 Terra (Max)96.5
14GPT-6 (Low)96.5
15Claude Fable 5.1 (xHigh)96.5

Interactive version: theaggregate.ai/benchmark?slug=arc-agi-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.