FrontierMath - Tier 4 (v2): leaderboard

Metric: Accuracy (%, 41 private v2 problems). Source: epoch.ai. 60 models tracked.

Top models

#ModelScore
1GPT-6 (Medium)97.56
2GPT-6 (Max)95.12
3GPT-6 (xHigh)95.12
4GPT-6 (High)95.12
5Claude Fable 5 (Max)87.8
6Claude Fable 5.1 (Max)87.8
7GPT-6 (Low)87.8
8GPT-5.6 Sol (Max)82.93
9GPT-6 (Non-reasoning)82.93
10GPT-5.5 Pro (xHigh)78.05
11Claude Opus 5 (Max)73.17
12GPT-5.5 (xHigh)72.5
13GPT-5.6 Terra (Max)70.73
14GPT-5.6 Luna (Max)60.98
15GPT-5.4 Pro (xHigh)58.54

Interactive version: theaggregate.ai/benchmark?slug=frontiermath-tier-4-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.