Vellum - ARC-AGI-2: leaderboard

Vellum's independently-run ARC-AGI-2 evaluation. Abstract pattern recognition and reasoning tasks.

Metric: Score (%). Source: www.vellum.ai. Status: saturation imminent. 16 models tracked.

Top models

#ModelScore
1GPT-695
2GPT-5.6 Sol92.5
3GPT-5.585
4Gemini 3.1 Pro (Preview)77.1
5Gemini 3.5 Flash72.1
6Claude Opus 4.668.8
7Claude Sonnet 4.658.3
8GPT-5.252.9
9Claude Opus 4.537.6
10Gemini 3 Pro31
11GPT-518
12GPT-5.118
13Grok 416
14Kimi K2.512
15Claude Opus 4.19

Interactive version: theaggregate.ai/benchmark?slug=vellum-arc-agi-2 · How It Works · Data refreshed daily, snapshot 2026-09-05.