OpenCompass Language - Dialogue - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)70.1
2Yi Lightning70.1
3GLM-4 Plus68.1
4Grok Beta63.3
5DeepSeek V2.563.2
6TeleChat262.4
7O1 Mini (2024-09-12)57.3
8Qwen 2.5 72B Instruct56.6
9Mistral Large 2 (Nov) Instruct (2411)55.2
10Step 2 16K55.2
11GLM-4 9B Chat52
12Yi 1.5 34B Chat50.5
13Yi-1.5-9B Chat50.1
14GPT-4o (2024-08-06)50
15Qwen 2.5 7B Instruct49.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-dialogue-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.