OpenCompass LLM - Reasoning (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)69.3
2GPT-5 (Thinking)69.3
3Gemini 2.5 Pro68.5
4O3 (2025-04-16) (High)68.4
5GLM-4.667.5
6Grok 465.5
7O4 Mini (2025-04-16) (High)65.5
8Qwen 3 235B A22B 2507 (Thinking)65.3
9Qwen 3 Next 80B A3B (Thinking)64.7
10Seed-OSS-36B-Instruct64.5
11Hunyuan-T1-2025082264.5
12DeepSeek V3.2 Exp63.8
13GPT-OSS-120B (High)63.7
14Ling-1T63.2
15DeepSeek R1 052862.5

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.