OpenCompass Math - Reasoning Computation - English (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1O3 (2025-04-16) (High)86.2
2GPT-5 (Thinking)86.2
3Qwen 3 235B A22B 2507 (Thinking)85
4GPT-OSS-120B (High)83.8
5DeepSeek R1 052881.9
6Seed-OSS-36B-Instruct81.2
7O4 Mini (2025-04-16) (High)80.6
8GLM-4.680
9Nanbeige3.5-Pro (Thinking)78.8
10Grok 478.1
11Qwen 3 Next 80B A3B (Thinking)78.1
12MiniMax-M276.9
13Claude Sonnet 4.5 (Thinking)76.2
14Hunyuan-T1-2025082273.1
15Gemini 2.5 Pro72.5

Interactive version: theaggregate.ai/benchmark?slug=opencompass-math-reasoning-computation-english-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.