OpenCompass LLM - Reasoning - Chinese (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1O3 (2025-04-16) (High)67.7
2Doubao-Seed-1.6-thinking-25071567.6
3Gemini 2.5 Pro66.9
4GPT-565.3
5O4 Mini (2025-04-16) (High)64.7
6Grok 463.7
7Qwen 3 235B A22B 2507 (Thinking)63.4
8GLM-4.562.8
9Claude Sonnet 4 (Thinking)61.4
10DeepSeek R1 052861.1
11Qwen 3 235B A22B 2507 Instruct60.9
12Kimi K259.2
13Hunyuan-T1-2025071159.2
14ERNIE-X1-Turbo-32K58.1
15Hunyuan A13B-Instruct57.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-chinese-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.