OpenCompass LLM - Reasoning - Chinese (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1ERNIE-X1-Turbo-32K92.8
2Qwen 3 235B A22B (Thinking)92.1
3Doubao-1.5-thinking-pro-25041591.7
4Gemini 2.5 Pro (Preview 05-06)91.6
5DeepSeek R191.4
6Qwen 3 32B (Thinking)91.1
7O3 Mini (High)90
8DeepSeek V3 (0324)89.5
9Grok 388.6
10O4 Mini (High)88.3
11GPT-4.1 (2025-04-14)87.6
12Qwen 3 235B A22B86.9
13GLM-4 32B (0414)86.9
14GPT-4.1 Mini85.1
15Llama 4 Maverick Instruct85.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-chinese-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.