OpenCompass Math - Reasoning Computation - Chinese (CompassBench 2501): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 40 models tracked.

Top models

#ModelScore
1O3 Mini (2025-01-31)60.6
2O1 (2024-12-17)56.9
3DeepSeek R153.1
4O1 Mini (2024-09-12)41.2
5QwQ 32B-Preview31.9
6GLM-Zero-Preview31.9
7Gemini 2.0 Pro (Preview 02-05)28.8
8Gemini 2.0 Flash (001)28.1
9Doubao-1.5-pro-32k-25011528.1
10DeepSeek V319.4
11Qwen 2.5 Max16.9
12Claude 3.5 Sonnet (20241022)12.5
13GPT-4o Mini (2024-07-18)11.9
14InternLM3-8B-Instruct9.4
15Qwen 2.5 72B Instruct8.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-math-reasoning-computation-chinese-compassbench-2501 · How It Works · Data refreshed daily, snapshot 2026-09-19.