MathArena - ARXIV_FALSE June — leaderboard

Metric: Accuracy (%). Source: matharena.ai. 14 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)69.44
2GPT-5.6 Sol (Max)67.28
3Muse Spark 1.150.62
4Claude Fable 5 (Max)47.84
5Claude Opus 4.8 (Max)41.67
6Grok 4.529.32
7Gemini 3.1 Pro (Preview)17.59
8DeepSeek V4 Flash (Max)16.67
9Step 3.7 Flash15.74
10GLM-5.214.2
11Gemini 3.5 Flash12.35
12Qwen 3.6 35B A3B3.4
13Qwen 3.5 2B2.78

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv-false-june · How the rankings work · Data refreshed daily, snapshot 2026-07-22.