OpenCompass LLM - Math (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Grok 468
2Qwen 3 235B A22B 2507 (Thinking)66.8
3MiniMax-M265.6
4GPT-5 (Thinking)65.6
5Seed-OSS-36B-Instruct64.5
6GPT-OSS-120B (High)64
7O3 (2025-04-16) (High)64
8Qwen 3 Next 80B A3B (Thinking)63.8
9DeepSeek R1 052863
10GLM-4.663
11Hunyuan-T1-2025082260.2
12O4 Mini (2025-04-16) (High)59.9
13Claude Sonnet 4.5 (Thinking)59.8
14Nanbeige3.5-Pro (Thinking)59.5
15Claude Haiku 4.5 (Thinking)58

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-math-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.