MathArena - ARXIV June: leaderboard

Metric: Accuracy (%). Source: matharena.ai. 16 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)86.73
2Claude Fable 5 (Max)83.67
3GPT-5.5 (xHigh)82.22
4Claude Opus 5 (Max)80.95
5Claude Opus 4.8 (Max)68.54
6Gemini 3.1 Pro (Preview)65.99
7Grok 4.565.99
8Gemini 3.6 Flash57.14
9Muse Spark 1.156.46
10Gemini 3.5 Flash53.06
11GLM-5.246.94
12DeepSeek V4 Flash (Max)42.86
13Step 3.7 Flash29.93
14Qwen 3.6 35B A3B26.53
15Qwen 3.5 2B4.08

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv-june · How It Works · Data refreshed daily, snapshot 2026-09-05.