AGI-Eval Community - Algorithmic Reasoning: leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 141 models tracked.

Top models

#ModelScore
1GPT-5.587.77
2Claude Fable 585.72
3Kimi K380.95
4Gemini 3.1 Pro (Preview)79.08
5Claude Sonnet 573.33
6Seed 2.1 Pro72.15
7DeepSeek V4 Pro (Max)71.92
8Gemini 3.5 Flash71.47
9GPT-5.471.25
10Gemini 3 Pro (Preview)70.32
11Gemini 3 Flash (Preview)69.03
12DeepSeek V4 Flash (Max)68.42
13GPT-5.167.93
14Seed 2.0 Pro67.6
15Claude Opus 4.867.53

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-algorithmic-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.