OpenCompass Math - Reasoning Computation - English (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1O4 Mini (High)80.6
2O3 Mini (High)78.8
3Doubao-1.5-thinking-pro-25041575.6
4DeepSeek R174.4
5Qwen 3 32B (Thinking)72.5
6Gemini 2.5 Pro (Preview 05-06)71.2
7ERNIE-X1-Turbo-32K66.9
8Qwen 3 235B A22B (Thinking)64.4
9DeepSeek V3 (0324)60.6
10Grok 358.1
11GPT-4.1 Mini45
12GPT-4.1 (2025-04-14)44.4
13Qwen 3 235B A22B40.6
14GLM-4 32B (0414)35
15Gemma 3 27B (IT)31.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-math-reasoning-computation-english-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.