FrontierMath - Tiers 1-3 (v2) — leaderboard

Metric: Accuracy (%, 285 private v2 problems). Source: epoch.ai. 38 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)89.12
2GPT-5.5 Pro (xHigh)87.72
3Claude Fable 5 (Max)87.02
4GPT-5.6 Terra (Max)85.96
5GPT-5.5 (xHigh)85.26
6GPT-5.4 Pro (xHigh)82.46
7GPT-5.6 Luna (Max)82.11
8Claude Opus 4.8 (Max)80
9GPT-5.4 (xHigh)78.6
10Kimi K3 (Max)72.18
11Claude Opus 4.7 (Max)70.18
12GPT-5.2 (xHigh)67.4
13Claude Opus 4.6 (Max)65.96
14Claude Sonnet 5 (Max)65.61
15Qwen 3.7 Max64.56

Interactive version: theaggregate.ai/benchmark?slug=frontiermath-tiers-1-3-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.