SuperCLUE General (September 2025) - Math Reasoning: leaderboard

Metric: Score. Source: www.superclueai.com. 37 models tracked.

Top models

#ModelScore
1GPT-5.1 (High)82.73
2Kimi K2 (Thinking)80.91
3Gemini 3 Pro (Preview)79.09
4O3 (High)77.27
5GPT-5 (High)73.64
6O4 Mini (High)72.73
7Gemini 2.5 Pro71.82
8GPT-OSS-120B70.91
9Qwen 3 Next 80B A3B (Thinking)66.36
10Gemini 2.5 Flash62.73
11Qwen 3 Max62.73
12Grok 4 Fast (Reasoning)62.73
13DeepSeek V3.2 Exp (Thinking)60.91
14Doubao-Seed-1.6-thinking-25071560.55
15DeepSeek V3.1 Terminus (Thinking)60

Interactive version: theaggregate.ai/benchmark?slug=superclue-general-september-2025-math-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.