OpenCompass Language - Dialogue - English (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1O4 Mini (2025-04-16) (High)84.3
2O3 (2025-04-16) (High)83.8
3GPT-OSS-120B (High)83.7
4Qwen 3 235B A22B 2507 (Thinking)83
5GPT-5 (Thinking)82.6
6Grok 482.1
7Claude Sonnet 4.5 (Thinking)82.1
8Claude Haiku 4.5 (Thinking)79.4
9Qwen 3 Next 80B A3B (Thinking)78.8
10Seed-OSS-36B-Instruct78.4
11DeepSeek R1 052877.1
12Kimi K2 090576.8
13Gemma 3 27B (IT)75.6
14Nanbeige3.5-Pro (Thinking)75.2
15Hunyuan-T1-2025082275.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-dialogue-english-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.