MathArena Arxiv: leaderboard

Metric: Accuracy (%). Source: matharena.ai. 13 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)87.5
2GPT-5.5 (xHigh)77.5
3Claude Opus 4.8 (Max)65
4GLM-5.256.67
5DeepSeek V4 Flash (Max)55.83
6Gemini 3.6 Flash54.17
7GLM-5.152.5
8Gemini 3.1 Pro (Preview)51.67
9Step 3.7 Flash46.67
10Gemini 3.5 Flash44.17
11Qwen 3.6 35B A3B37.5
12Qwen 3.5 2B10.62

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv · How It Works · Data refreshed daily, snapshot 2026-09-05.