AGI-Eval Community - Objective Accuracy (Chinese): leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 139 models tracked.

Top models

#ModelScore
1GPT-5.584.95
2Claude Fable 583.67
3Gemini 3.1 Pro (Preview)82.1
4Kimi K381.91
5Gemini 3.5 Flash80.6
6Seed 2.1 Pro80.47
7GPT-5.479.68
8Qwen 3.7 Max79.26
9Claude Opus 4.879.25
10DeepSeek V4 Pro (Max)79.17
11Seed 2.0 Pro78.9
12Kimi K2.678.69
13Claude Sonnet 578.07
14Claude Opus 4.677.91
15GLM-5.277.86

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-objective-accuracy-chinese · How It Works · Data refreshed daily, snapshot 2026-09-19.