OpenCompass LLM - Average - Chinese (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GPT-5 (Thinking)70
2O3 (2025-04-16) (High)68.6
3Qwen 3 235B A22B 2507 (Thinking)68.1
4GLM-4.667.7
5Claude Sonnet 4.5 (Thinking)67.3
6O4 Mini (2025-04-16) (High)66.8
7Grok 465.8
8DeepSeek R1 052865.7
9Hunyuan-T1-2025082265.7
10Gemini 2.5 Pro64.8
11Qwen 3 Next 80B A3B (Thinking)64.4
12Seed-OSS-36B-Instruct63.7
13Claude Haiku 4.5 (Thinking)63.6
14GPT-OSS-120B (High)63.4
15DeepSeek V3.2 Exp62.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-average-chinese-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.