OpenCompass Reasoning - Common - Chinese (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 20 models tracked.

Top models

#ModelScore
1Doubao-Seed-1.6-thinking-25071588.4
2Qwen 3 235B A22B 2507 Instruct83.7
3GPT-581.4
4Claude Sonnet 4 (Thinking)80.2
5ERNIE-X1-Turbo-32K80.2
6Hunyuan-T1-2025071180.2
7DeepSeek V3 (0324)79.1
8GLM-4.579.1
9Grok 475.6
10Kimi K275.6
11GPT-4.1 (2025-04-14)73.3
12GLM 4.5 Air69.8
13MiniMax M1 80k69.8
14MiniMax-Text-0158.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-chinese-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.