Vellum - AIME 2025 — leaderboard

Vellum's independently-run AIME 2025 evaluation. American Invitational Mathematics Examination problems.

Metric: Accuracy (%). Source: www.vellum.ai. Status: saturated. 28 models tracked.

Top models

#ModelScore
1GPT-5.2100
2Gemini 3 Pro100
3Human Expert100
4Claude Opus 4.699.8
5Kimi K2 (Thinking)99.1
6GPT-OSS-20B98.7
7O398.4
8GPT-OSS-120B97.9
9Claude Haiku 4.596.3
10Kimi K2.596.1
11GPT-5.194
12Grok 393.3
13O4 Mini92.7
14Grok 491.7
15GPT-591

Interactive version: theaggregate.ai/benchmark?slug=vellum-aime-2025 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.