OpenCompass LLM - Reasoning - English (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1GPT-566.6
2O3 (2025-04-16) (High)64.3
3Gemini 2.5 Pro63.8
4GLM-4.563.6
5Grok 463.3
6Doubao-Seed-1.6-thinking-25071563.2
7Qwen 3 235B A22B 2507 (Thinking)62.3
8O4 Mini (2025-04-16) (High)62.2
9Claude Sonnet 4 (Thinking)60.3
10Hunyuan-T1-2025071159.6
11DeepSeek R1 052859.4
12GLM 4.5 Air58.6
13Kimi K256.6
14Qwen 3 235B A22B 2507 Instruct56.5
15ERNIE-X1-Turbo-32K56.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-english-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.