OpenCompass LLM - Reasoning - English (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)70.3
2GPT-5 (Thinking)69.4
3O3 (2025-04-16) (High)67.4
4Gemini 2.5 Pro66.6
5Grok 466.3
6GLM-4.666.2
7Qwen 3 Next 80B A3B (Thinking)64.4
8GPT-OSS-120B (High)64.4
9O4 Mini (2025-04-16) (High)64.2
10Qwen 3 235B A22B 2507 (Thinking)63.6
11DeepSeek V3.2 Exp63.3
12Seed-OSS-36B-Instruct63
13Claude Haiku 4.5 (Thinking)62.9
14Ling-1T62.9
15DeepSeek R1 052862.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-english-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.