OpenCompass Reasoning - Common - English (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)79.1
2O3 (2025-04-16) (High)77.9
3Qwen 3 Next 80B A3B (Thinking)76.7
4Claude Haiku 4.5 (Thinking)74.4
5GPT-OSS-120B (High)73.3
6Hunyuan A13B-Instruct73.3
7Seed-OSS-36B-Instruct73.3
8O4 Mini (2025-04-16) (High)73.3
9Ling-1T73.3
10GPT-5 (Thinking)73.3
11Hunyuan-T1-2025082273.3
12Gemini 2.5 Pro72.1
13Grok 472.1
14Kimi K2 090572.1
15Qwen 3 235B A22B 2507 (Thinking)70.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-english-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.