OpenCompass Reasoning - Academic - English (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GPT-5 (Thinking)53.3
2GLM-4.642.5
3Claude Sonnet 4.5 (Thinking)40
4Gemini 2.5 Pro39.2
5O3 (2025-04-16) (High)39.2
6Grok 438.3
7DeepSeek V3.2 Exp35
8GPT-OSS-120B (High)35
9O4 Mini (2025-04-16) (High)30.8
10DeepSeek R1 052830
11Qwen 3 Next 80B A3B (Thinking)26.7
12Qwen 3 235B A22B 2507 (Thinking)26.7
13Hunyuan-T1-2025082226.7
14Claude Haiku 4.5 (Thinking)25.8
15Nanbeige3.5-Pro (Thinking)25.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-academic-english-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.