OpenCompass LLM - Average - English (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 05-06)73.6
2O4 Mini (High)73
3Doubao-1.5-thinking-pro-25041572.3
4Qwen 3 235B A22B (Thinking)72.2
5DeepSeek R171.5
6ERNIE-X1-Turbo-32K71.1
7Qwen 3 32B (Thinking)70.6
8O3 Mini (High)70.2
9Grok 366.6
10GPT-4.1 (2025-04-14)65.2
11DeepSeek V3 (0324)65.2
12GPT-4.1 Mini63.9
13Qwen 3 235B A22B62.7
14Claude 3.7 Sonnet (Thinking)60.5
15Gemma 3 27B (IT)59.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-average-english-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.