OpenCompass LLM - Reasoning (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1GPT-566
2O3 (2025-04-16) (High)66
3Gemini 2.5 Pro65.4
4Doubao-Seed-1.6-thinking-25071565.4
5Grok 463.5
6O4 Mini (2025-04-16) (High)63.5
7GLM-4.563.2
8Qwen 3 235B A22B 2507 (Thinking)62.8
9Claude Sonnet 4 (Thinking)60.8
10DeepSeek R1 052860.3
11Hunyuan-T1-2025071159.4
12Qwen 3 235B A22B 2507 Instruct58.7
13Kimi K257.9
14GLM 4.5 Air57.5
15ERNIE-X1-Turbo-32K57.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.