OpenCompass Language - NLP - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)66.1
2Yi Lightning65.4
3GLM-4 Plus63.8
4O1 Mini (2024-09-12)63.7
5Qwen 2.5 72B Instruct62.2
6GPT-4o (2024-11-20)61.5
7Grok Beta61.1
8Step 2 16K60.2
9TeleChat260.1
10DeepSeek V2.558.9
11Gemma 2 9B (IT)57.2
12360gpt2-pro55.8
13Mistral Large 2 (Nov) Instruct (2411)53.4
14Gemma 2 27B (IT)52.2
15Qwen 2.5 7B Instruct52

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-nlp-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.