OpenCompass LLM - Reasoning - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro70.5
2O3 (2025-04-16) (High)69.5
3GPT-5 (Thinking)69.2
4GLM-4.668.9
5Claude Sonnet 4.5 (Thinking)68.2
6Qwen 3 235B A22B 2507 (Thinking)67.1
7O4 Mini (2025-04-16) (High)66.8
8Hunyuan-T1-2025082266.1
9Seed-OSS-36B-Instruct65.9
10Qwen 3 Next 80B A3B (Thinking)65
11Grok 464.7
12DeepSeek V3.2 Exp64.4
13Ling-1T63.5
14GPT-OSS-120B (High)62.9
15DeepSeek R1 052862.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.