OpenCompass LLM - Reasoning (CompassBench 2601): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 26 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)61.5
2GPT-5.2 (High)60.1
3Claude Opus 4.5 (Thinking)56.8
4Kimi K2.554.7
5Qwen 3 Max (2026-01-23)52.5
6O3 (2025-04-16) (High)51.5
7DeepSeek V3.251.2
8Claude Sonnet 4.5 (Thinking)50.7
9GLM-4.750.4
10GPT-OSS-120B (High)49.3
11Grok 4.149
12Tencent HY 2.0 Think48.3
13Ring-1T44.9
14Qwen 3 235B A22B 2507 (Thinking)44.4
15Kimi K2 (Thinking)44.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-compassbench-2601 · How It Works · Data refreshed daily, snapshot 2026-09-19.