MathArena - ArXiv Math Jan 2026: leaderboard

Metric: Accuracy (%). Source: matharena.ai. 27 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)76.09
2GPT-5.5 (xHigh)73.91
3DeepSeek V4 Pro (Max)73.91
4Claude Opus 4.6 (High)72.83
5Kimi K2.6 (Thinking)71.74
6Gemini 3.1 Pro (Preview)70.65
7GPT-5.2 (High)67.93
8Gemini 3.1 Pro (Preview) (Medium)67.39
9GLM-5.165.22
10Kimi K2.5 (Thinking)62.5
11Gemini 3 Pro (Preview)61.96
12Step 3.5 Flash60.33
13Gemini 3 Flash58.15
14DeepSeek V3.2 (Thinking)57.07
15Qwen 3.5 397B A17B54.89

Interactive version: theaggregate.ai/benchmark?slug=matharena-arxiv-math-jan-2026 · How It Works · Data refreshed daily, snapshot 2026-09-05.