OpenCompass LLM - Reasoning: leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 15 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)68.4
2GPT-5.5 (High)66.9
3GPT-5.6 Sol (High)66.8
4Qwen 3.8 Max65.2
5Claude Opus 4.8 (High)64.1
6Kimi K3 (High)63.9
7Gemini 3.7 Flash62.1
8GLM-5.362
9DeepSeek V4 Flash61
10Grok 4.6 (High)60
11DeepSeek V4 Pro55.5
12Hy3-preview (High)54.6
13MiniMax-M354

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.