OpenCompass Language - NLP - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B 2507 (Thinking)86.4
2GPT-OSS-120B (High)84.5
3Qwen 3 Next 80B A3B (Thinking)83.2
4Claude Haiku 4.5 (Thinking)83
5O3 (2025-04-16) (High)82.9
6DeepSeek R1 052881.6
7Grok 481.2
8Nanbeige3.5-Pro (Thinking)81.2
9Claude Sonnet 4.5 (Thinking)80.7
10Gemini 2.5 Pro79.7
11Hunyuan-T1-2025082279
12Ling-1T78.8
13GPT-5 (Thinking)78.8
14GLM-4.676.8
15DeepSeek V3.2 Exp76.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-nlp-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.