MathArena Arxiv — leaderboard

Metric: Accuracy (%). Source: matharena.ai. 12 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)87.5
2GPT-5.5 (xHigh)77.5
3Claude Opus 4.8 (Max)65
4GLM-5.256.67
5DeepSeek V4 Flash (Max)55.83
6GLM-5.152.5
7Gemini 3.1 Pro (Preview)51.67
8Step 3.7 Flash46.67
9Gemini 3.5 Flash44.17
10Qwen 3.6 35B A3B37.5
11Qwen 3.5 2B10.62

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv · How the rankings work · Data refreshed daily, snapshot 2026-07-22.