OpenCompass LLM - Reasoning - English (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B (Thinking)92.6
2Doubao-1.5-thinking-pro-25041592.2
3ERNIE-X1-Turbo-32K91.8
4DeepSeek R191
5O3 Mini (High)90.8
6O4 Mini (High)89.3
7Gemini 2.5 Pro (Preview 05-06)89.3
8Grok 389.1
9Qwen 3 32B (Thinking)89.1
10DeepSeek V3 (0324)88.4
11GPT-4.1 (2025-04-14)86.7
12Qwen 3 235B A22B86.5
13GPT-4.1 Mini86.4
14Claude 3.7 Sonnet (Thinking)85
15GLM-4 32B (0414)84.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-english-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.