OpenCompass Reasoning - Academic - Chinese (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1ERNIE-X1-Turbo-32K93
2Qwen 3 235B A22B (Thinking)92
3DeepSeek R191.6
4Doubao-1.5-thinking-pro-25041591.3
5Qwen 3 32B (Thinking)91.2
6Gemini 2.5 Pro (Preview 05-06)89.7
7O3 Mini (High)89.6
8O4 Mini (High)89.3
9Grok 388.9
10Llama 4 Maverick Instruct87.1
11DeepSeek V3 (0324)86
12GPT-4.1 (2025-04-14)85.9
13Qwen 3 235B A22B85
14GPT-4.1 Mini84.9
15Claude 3.7 Sonnet (Thinking)84.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-academic-chinese-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.