OpenCompass Language - NLP - Chinese (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B 2507 Instruct79.2
2DeepSeek R1 052876.1
3Doubao-Seed-1.6-thinking-25071576
4Qwen 3 235B A22B 2507 (Thinking)74.6
5Grok 474.3
6GPT-572.4
7Gemini 2.5 Pro72.1
8GLM 4.5 Air71.8
9DeepSeek V3 (0324)71.2
10Gemma 3 27B (IT)70.8
11GPT-4.1 (2025-04-14)69.2
12Claude Sonnet 4 (Thinking)68.7
13O3 (2025-04-16) (High)67.9
14O4 Mini (2025-04-16) (High)67.9
15GLM-4.565.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-nlp-chinese-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.