AGI-Eval Community - Interaction (English): leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 139 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)95.45
2Gemini 3.5 Flash95.2
3Seed 2.1 Pro94.97
4Claude Fable 594.92
5Claude Opus 4.894.77
6Claude Opus 4.694.75
7Qwen 3.7 Max94.73
8Kimi K394.54
9Seed 2.0 Pro94.52
10GLM-5.294.38
11Gemini 3 Pro (Preview)94.31
12GPT-5.594.17
13Kimi K2.5 (Thinking)93.89
14Claude Sonnet 4.5 (Thinking)93.86
15Qwen 3.5 397B A17B (Thinking)93.84

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-interaction-english · How It Works · Data refreshed daily, snapshot 2026-09-19.