AGI-Eval Community - Cognition (English): leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 139 models tracked.

Top models

#ModelScore
1Claude Opus 4 (Thinking)89.88
2Claude Opus 4.688.41
3Grok 487.63
4Claude Opus 4.5 (Non-reasoning)87.19
5Gemini 3 Flash (Preview)87.06
6Gemini 3.1 Pro (Preview)86.97
7Gemini 3.5 Flash86.85
8Claude Fable 586.78
9Seed 1.886.63
10Claude Sonnet 4 (Thinking)86.34
11Seed 2.0 Pro86.05
12Kimi K2.685.74
13Claude Opus 4.885.69
14O3 Pro85.56
15Doubao-Seed-1.6 (Thinking)85.56

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-cognition-english · How It Works · Data refreshed daily, snapshot 2026-09-19.