OpenCompass Reasoning - Common - English (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Doubao-1.5-thinking-pro-25041590.1
2DeepSeek R189.5
3ERNIE-X1-Turbo-32K89
4O3 Mini (High)87.2
5Qwen 3 235B A22B (Thinking)87.2
6O4 Mini (High)86.6
7GPT-4.1 (2025-04-14)86
8Qwen 3 32B (Thinking)86
9Gemini 2.5 Pro (Preview 05-06)85.5
10Grok 384.9
11DeepSeek V3 (0324)84.9
12Qwen 3 235B A22B83.1
13GLM-4 32B (0414)83.1
14GPT-4.1 Mini82.6
15Llama 4 Maverick Instruct82.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-english-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.