OpenCompass Reasoning - Humanities - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)71.1
2GLM-4 Plus70.1
3Yi Lightning70
4O1 Mini (2024-09-12)65.2
5Grok Beta64.2
6DeepSeek V2.563.5
7Qwen 2.5 72B Instruct62.4
8TeleChat261.4
9360gpt2-pro58.9
10Claude 3.5 Sonnet (20241022)54.8
11Mistral Large 2 (Nov) Instruct (2411)53.4
12GPT-4o (2024-08-06)50
13Step 2 16K49.8
14GLM-4 9B Chat48.5
15Qwen 2.5 7B Instruct47

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-humanities-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.