OpenCompass Reasoning - Common - Chinese (CompassBench 2501): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 40 models tracked.

Top models

#ModelScore
1DeepSeek R191.5
2O1 (2024-12-17)88.5
3O3 Mini (2025-01-31)87.8
4O1 Mini (2024-09-12)85.8
5Doubao-1.5-pro-32k-25011577.7
6GLM-Zero-Preview74.3
7Gemini 2.0 Pro (Preview 02-05)73.3
8Gemini 2.0 Flash (001)69.9
9QwQ 32B-Preview69.9
10Qwen 2.5 Max69.6
11DeepSeek V368.6
12Qwen 2.5 72B Instruct63.2
13Claude 3.5 Sonnet (20241022)62.8
14GLM-4 Plus61.8
15GPT-4o (2024-11-20)60.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-chinese-compassbench-2501 · How It Works · Data refreshed daily, snapshot 2026-09-19.