OpenCompass Language - Dialogue - English (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1GLM-4 Plus68
2Yi Lightning67.3
3DeepSeek V2.565.4
4Grok Beta64.8
5TeleChat263.5
6O1 Mini (2024-09-12)62.4
7Yi 1.5 34B Chat61.5
8Step 2 16K60
9Mistral Large 2 (Nov) Instruct (2411)58.9
10Yi-1.5-9B Chat58.6
11Llama 3.1 70B Instruct57.5
12Qwen 2.5 72B Instruct56.7
13GPT-4o (2024-11-20)56.5
14GLM-4 9B Chat55.9
15Llama 3.1 405B Instruct FP854.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-dialogue-english-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.