MathArena - ARXIV_FALSE June: leaderboard

Metric: Accuracy (%). Source: matharena.ai. 16 models tracked.

Top models

#ModelScore
1Claude Opus 5 (Max)90.74
2GPT-5.5 (xHigh)69.44
3GPT-5.6 Sol (Max)67.28
4Muse Spark 1.150.62
5Claude Fable 5 (Max)47.84
6Claude Opus 4.8 (Max)41.67
7Grok 4.529.32
8Gemini 3.1 Pro (Preview)17.59
9DeepSeek V4 Flash (Max)16.67
10Step 3.7 Flash15.74
11GLM-5.214.2
12Gemini 3.5 Flash12.35
13Gemini 3.6 Flash12.04
14Qwen 3.6 35B A3B3.4
15Qwen 3.5 2B2.78

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv-false-june · How It Works · Data refreshed daily, snapshot 2026-09-05.