AIME: leaderboard

National math exam given to top high-school students.

Metric: Accuracy (%). Source: www.vals.ai. Status: saturated. 96 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview) (High)98.12
2GPT-5.2 (xHigh)96.88
3Muse Spark96.88
4Gemini 3 Pro (Preview) (High)96.68
5GPT-5.4 (xHigh)96.67
6Grok 4.20 0309 (Reasoning)96.46
7Claude Opus 4.796.25
8Kimi K2.5 (Thinking)95.62
9Claude Opus 4.6 (Thinking)95.62
10GPT-5.4 Mini (xHigh)95.62
11Gemini 3 Flash (Preview) (High)95.62
12Claude Opus 4.5 (20251101) (Thinking)95.42
13Qwen 3.6 Plus94.58
14GPT-5 (High)93.37
15GLM-4.793.33

Interactive version: theaggregate.ai/benchmark?slug=aime · How It Works · Data refreshed daily, snapshot 2026-09-05.