OpenCompass Language - Dialogue - English (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B 2507 (Thinking)84.5
2DeepSeek R1 052883.7
3ERNIE-X1-Turbo-32K79.4
4Qwen 3 235B A22B 2507 Instruct79
5Claude Sonnet 4 (Thinking)76.3
6DeepSeek V3 (0324)75.6
7O3 (2025-04-16) (High)75.5
8Doubao-Seed-1.6-thinking-25071575.3
9Grok 475
10GPT-4.1 (2025-04-14)74.9
11Hunyuan-T1-2025071174.2
12Kimi K273.4
13GPT-573.3
14O4 Mini (2025-04-16) (High)73
15Gemma 3 27B (IT)72.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-dialogue-english-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.