AGI-Eval Community - Interaction (Chinese): leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 139 models tracked.

Top models

#ModelScore
1Claude Opus 4.889.93
2Claude Fable 589.52
3GPT-5.589.4
4GPT-5.488.45
5Claude Opus 4.688.39
6Seed 2.0 Pro88.35
7Gemini 3.1 Pro (Preview)87.99
8Kimi K387.74
9Gemini 3.5 Flash87.45
10Seed 2.1 Pro87.31
11Gemini 3 Flash (Preview)86.86
12Qwen 3.7 Max86.71
13O3 Pro85.87
14Claude Sonnet 585.67
15Kimi K2.685.28

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-interaction-chinese · How It Works · Data refreshed daily, snapshot 2026-09-19.