SuperCLUE General (March 2026) - Math Reasoning: leaderboard

Metric: Score. Source: www.superclueai.com. 24 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview) (High)92.44
2DeepSeek V4 Flash (Max)89.08
3GPT-5.4 (xHigh)88.89
4DeepSeek V4 Pro (Max)87.39
5Grok 4.20 Beta (0309) (Reasoning)85.71
6Gemini 3 Flash (Preview) (High)85.71
7Claude Opus 4.6 (Max)85.71
8Qwen 3.5 397B A17B (Thinking)84.87
9MiMo-V2-Pro84.03
10Qwen 3.5 122B A10B (Thinking)82.35
11Kimi K2.5 (Thinking)81.51
12Step 3.5 Flash80.67
13GPT-OSS-120B (High)79.83
14MiniMax-M2.778.15
15DeepSeek V3.2 (Thinking)78.15

Interactive version: theaggregate.ai/benchmark?slug=superclue-general-march-2026-math-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.