OpenCompass Math - Reasoning Computation - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1O3 (2025-04-16) (High)67.5
2Qwen 3 235B A22B 2507 (Thinking)66.9
3GPT-5 (Thinking)66.2
4Seed-OSS-36B-Instruct65.6
5O4 Mini (2025-04-16) (High)65.6
6GPT-OSS-120B (High)65
7Grok 463.8
8Qwen 3 Next 80B A3B (Thinking)61.9
9DeepSeek R1 052861.9
10MiniMax-M260.6
11Hunyuan-T1-2025082260
12Nanbeige3.5-Pro (Thinking)60
13Claude Sonnet 4.5 (Thinking)59.4
14Claude Haiku 4.5 (Thinking)58.8
15GLM-4.655

Interactive version: theaggregate.ai/benchmark?slug=opencompass-math-reasoning-computation-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.