OTIS Mock AIME 2024-25: leaderboard

Mock AIME competition problems from the OTIS math olympiad program. Tests creative mathematical problem-solving at olympiad level. Evaluated by Epoch AI.

Metric: Accuracy (%). Source: epoch.ai. Status: saturated. 288 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)100
2GPT-5.6 Sol (Max)100
3Claude Fable 5.1 (Max)100
4GPT-6 (Max)100
5Best Expert100
6Claude Fable 5 (High)100
7GPT-5.5 Pro (xHigh)100
8Claude Fable 5 (Max)99.72
9GPT-5.6 Terra (Max)99.72
10Qwen 3.8 Max (xHigh)99.44
11Grok 4.6 (xHigh)99.17
12Claude Opus 5 (Max)98.89
13DeepSeek V4 Pro (0813) (Max)98.61
14Claude Opus 4.8 (Max)98.33
15GPT-5.6 Luna (Max)98.33

Interactive version: theaggregate.ai/benchmark?slug=otis-mock-aime-2024-25 · How It Works · Data refreshed daily, snapshot 2026-09-05.