OpenCompass Language - Instruction Following - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GPT-5 (Thinking)87.8
2GPT-OSS-120B (High)87
3Qwen 3 235B A22B 2507 (Thinking)82.2
4O3 (2025-04-16) (High)81.4
5Hunyuan-T1-2025082281
6O4 Mini (2025-04-16) (High)80.4
7Grok 478.1
8Nanbeige3.5-Pro (Thinking)76.8
9DeepSeek R1 052876.7
10Ling-1T75.8
11DeepSeek V3.2 Exp74.9
12Claude Haiku 4.5 (Thinking)74.6
13Qwen 3 Next 80B A3B (Thinking)74.5
14Seed-OSS-36B-Instruct74.5
15Gemini 2.5 Pro74.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-instruction-following-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.