AGI-Eval Community - Mathematical Reasoning: leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 141 models tracked.

Top models

#ModelScore
1Claude Fable 589.37
2Claude Opus 4.888.21
3Qwen 3.7 Max88.11
4Kimi K2.688.04
5Seed 2.0 Pro87.58
6Claude Opus 4.587.18
7Claude Sonnet 586.98
8DeepSeek V4 Flash (Max)86.96
9Claude Opus 4.686.76
10Kimi K2.5 (Thinking)86.75
11Gemini 3.5 Flash86.74
12Qwen 3 Max (Thinking)86.73
13Gemini 3.1 Pro (Preview)86.55
14DeepSeek V4 Pro (Max)86.24
15Seed 2.1 Pro86.21

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-mathematical-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.