OpenCompass Reasoning - Academic - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1O3 (2025-04-16) (High)46.7
2GPT-5 (Thinking)43.3
3GLM-4.642.5
4Gemini 2.5 Pro41.7
5Claude Sonnet 4.5 (Thinking)38.3
6Grok 435.8
7O4 Mini (2025-04-16) (High)31.7
8Qwen 3 235B A22B 2507 (Thinking)29.2
9GPT-OSS-120B (High)29.2
10DeepSeek V3.2 Exp26.7
11Seed-OSS-36B-Instruct26.7
12DeepSeek R1 052825
13Hunyuan-T1-2025082225
14Qwen 3 Next 80B A3B (Thinking)21.7
15Ling-1T21.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-academic-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.