AGI-Eval Community - General Reasoning: leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 141 models tracked.

Top models

#ModelScore
1Claude Fable 597.82
2Gemini 3.1 Pro (Preview)97.68
3Claude Opus 4.697.66
4Qwen 3.7 Max97.56
5Gemini 3 Pro (Preview)97.51
6Kimi K397.5
7Ring-1T97.49
8Seed 2.1 Pro97.48
9Claude Opus 4 (Thinking)97.47
10Kimi K2.697.45
11Gemini 3.5 Flash97.45
12ERNIE 5.0 Thinking Preview97.41
13DeepSeek V4 Pro (Max)97.38
14Qwen 3 Next 80B A3B Instruct97.36
15GPT-5.597.34

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-general-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.