AGI-Eval Community - Learning (Chinese): leaderboard

Metric: Accuracy (%). Source: agi-eval.cn. 139 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)91.15
2Gemini 3 Flash (Preview)89.43
3Gemini 3 Pro (Preview)87.49
4Gemini 3.5 Flash87.2
5GLM-5.187.13
6GLM-586.81
7GPT-5.586.42
8Claude Opus 4.686.3
9Claude Fable 586.16
10GLM-5.286.08
11DeepSeek V4 Pro (Max)85.9
12Gemini 2.5 Flash85.84
13Qwen 3.7 Max85.73
14GLM-4.785.67
15Kimi K2.585.64

Interactive version: theaggregate.ai/benchmark?slug=agi-eval-community-learning-chinese · How It Works · Data refreshed daily, snapshot 2026-09-19.