AGI-Eval Community - Subject Reasoning: leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 141 models tracked.

Top models

#ModelScore
1Claude Opus 4.890.01
2GPT-5.589.61
3Claude Fable 589.25
4Seed 2.0 Pro89.25
5Gemini 3.5 Flash88.92
6Seed 2.1 Pro88.88
7Qwen 3.7 Max88.84
8Kimi K388.84
9Claude Opus 4.688.81
10Gemini 3.1 Pro (Preview)88.63
11Gemini 3 Pro (Preview)88.55
12Kimi K2.688.55
13Kimi K2.5 (Thinking)88.01
14DeepSeek V4 Flash (Max)87.97
15Claude Opus 4.587.93

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-subject-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.