OpenCompass Math - Reasoning Computation - Chinese (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1O3 Mini (High)65
2O4 Mini (High)64.4
3Doubao-1.5-thinking-pro-25041559.4
4Gemini 2.5 Pro (Preview 05-06)57.5
5Qwen 3 235B A22B (Thinking)56.2
6DeepSeek R154.4
7ERNIE-X1-Turbo-32K53.8
8Qwen 3 32B (Thinking)51.9
9Grok 345.6
10DeepSeek V3 (0324)45.6
11GPT-4.1 (2025-04-14)31.2
12GPT-4.1 Mini29.4
13Qwen 3 235B A22B29.4
14Llama 4 Maverick Instruct28.8
15GLM-4 32B (0414)27.5

Interactive version: theaggregate.ai/benchmark?slug=opencompass-math-reasoning-computation-chinese-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.