OpenCompass Reasoning - Common - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Hunyuan-T1-2025082284.9
2Qwen 3 Next 80B A3B (Thinking)82.6
3O4 Mini (2025-04-16) (High)81.4
4Ling-1T81.4
5GPT-5 (Thinking)81.4
6GLM-4.680.2
7DeepSeek V3.2 Exp80.2
8Gemini 2.5 Pro79.1
9Qwen 3 235B A22B 2507 (Thinking)79.1
10Claude Haiku 4.5 (Thinking)79.1
11Claude Sonnet 4.5 (Thinking)77.9
12Seed-OSS-36B-Instruct77.9
13Nanbeige3.5-Pro (Thinking)77.9
14Kimi K2 090576.7
15GPT-OSS-120B (High)76.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.