FrontierMath - Tier 4 (v2) — leaderboard

Metric: Accuracy (%, 41 private v2 problems). Source: epoch.ai. 40 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)87.8
2GPT-5.6 Sol (Max)82.93
3GPT-5.5 Pro (xHigh)78.05
4GPT-5.5 (xHigh)72.5
5GPT-5.6 Terra (Max)70.73
6GPT-5.6 Luna (Max)60.98
7GPT-5.4 Pro (xHigh)58.54
8Claude Opus 4.8 (Max)56.1
9GPT-5.4 (xHigh)49
10Kimi K3 (Max)39.02
11Qwen 3.7 Max34.15
12Claude Opus 4.7 (Max)31.71
13GPT-5.2 (xHigh)31.7
14GLM-5.2 (Max)29.27
15Claude Sonnet 5 (Max)29.27

Interactive version: theaggregate.ai/benchmark?slug=frontiermath-tier-4-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.