OpenCompass Reasoning - Common - Chinese (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B (Thinking)92.4
2Gemini 2.5 Pro (Preview 05-06)91.9
3ERNIE-X1-Turbo-32K91.9
4Doubao-1.5-thinking-pro-25041590.7
5DeepSeek R190.1
6DeepSeek V3 (0324)90.1
7Qwen 3 32B (Thinking)89.5
8O4 Mini (High)88.4
9GLM-4 32B (0414)87.8
10O3 Mini (High)87.8
11GPT-4.1 (2025-04-14)87.2
12Grok 387.2
13Qwen 3 235B A22B85.5
14Llama 4 Maverick Instruct84.9
15GPT-4.1 Mini83.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-chinese-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.