Vellum - ARC-AGI-2 — leaderboard

Vellum's independently-run ARC-AGI-2 evaluation. Abstract pattern recognition and reasoning tasks.

Metric: Score (%). Source: www.vellum.ai. Status: saturation imminent. 14 models tracked.

Top models

#ModelScore
1GPT-5.585
2Gemini 3.1 Pro (Preview)77.1
3Gemini 3.5 Flash72.1
4Claude Opus 4.668.8
5Claude Sonnet 4.658.3
6GPT-5.252.9
7Claude Opus 4.537.6
8Gemini 3 Pro31
9GPT-518
10GPT-5.118
11Grok 416
12Kimi K2.512
13Claude Opus 4.19
14O37

Interactive version: theaggregate.ai/benchmark?slug=vellum-arc-agi-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.