MathArena - IMProofBench Final Answers — leaderboard

Metric: Accuracy (%). Source: matharena.ai. 17 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)83.52
2Claude Opus 4.6 (High)80.74
3GPT-5.2 (xHigh)73.17
4Gemini 3 Pro (Preview)72.28
5GPT-5.1 (High)62.01
6GPT-5 Pro59.29
7Grok 457.48
8GPT-5 (High)53.8
9O4 Mini (High)45.22
10Grok 4 Fast (Reasoning)44.05
11O3 (High)41.27
12Gemini 2.5 Pro39.15
13Claude Opus 4.1 (Thinking)38.42
14Gemini 2.5 Flash (Thinking)37.46
15GPT-OSS-120B (High)37.32

Interactive version: theaggregate.ai/benchmark?slug=matharena-improofbench-final-answers · How the rankings work · Data refreshed daily, snapshot 2026-07-22.