MathArena - ARXIV June — leaderboard

Metric: Accuracy (%). Source: matharena.ai. 14 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)86.73
2Claude Fable 5 (Max)82.31
3GPT-5.5 (xHigh)82.22
4Claude Opus 4.8 (Max)68.54
5Gemini 3.1 Pro (Preview)65.99
6Grok 4.565.99
7Muse Spark 1.156.46
8Gemini 3.5 Flash53.06
9GLM-5.246.94
10DeepSeek V4 Flash (Max)42.86
11Step 3.7 Flash29.93
12Qwen 3.6 35B A3B26.53
13Qwen 3.5 2B4.08

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv-june · How the rankings work · Data refreshed daily, snapshot 2026-07-22.