MathArena - ArXiv Math Jan 2026 — leaderboard

Metric: Accuracy (%). Source: matharena.ai. 27 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)76.09
2GPT-5.5 (xHigh)73.91
3DeepSeek V4 Pro (Max)73.91
4Claude Opus 4.6 (High)72.83
5Kimi K2.6 (Thinking)71.74
6Gemini 3.1 Pro (Preview)70.65
7GPT-5.2 (High)67.93
8GLM-5.165.22
9Kimi K2.5 (Thinking)62.5
10Gemini 3 Pro (Preview)61.96
11Step 3.5 Flash60.33
12Gemini 3 Flash58.15
13DeepSeek V3.2 (Thinking)57.07
14Qwen 3.5 397B A17B54.89
15GLM-554.35

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv-math-jan-2026 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.