OpenCompass Reasoning - Common Sense - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1Yi Lightning71.2
2GLM-4 Plus69.2
3O1 Mini (2024-09-12)69
4GPT-4o (2024-11-20)68
5TeleChat267
6DeepSeek V2.564.4
7Grok Beta63.1
8Claude 3.5 Sonnet (20241022)62.6
9Qwen 2.5 72B Instruct61.4
10360gpt2-pro58.5
11Mistral Large 2 (Nov) Instruct (2411)57.8
12Step 2 16K56.8
13GPT-4o (2024-08-06)50
14Qwen 2.5 7B Instruct49.8
15Gemma 2 27B (IT)45.3

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-sense-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.