OpenCompass Reasoning - Humanities - Chinese (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1GLM-4 Plus66.8
2Step 2 16K62.4
3Gemini 1.5 Pro61.2
4GPT-4o (2024-05-13)59.1
5DeepSeek V2.559
6Qwen 2.5 72B Instruct58.9
7Claude 3.5 Sonnet (20240620)54.4
8Mistral Large 2 (Jul)50
9Yi Large49
10GPT-4o (2024-08-06)48.9
11GPT-4o Mini (2024-07-18)48.2
12Gemma 2 27B (IT)47.9
13Gemma 2 9B (IT)47.4
14Yi-1.5-9B Chat43.8
15Qwen 2.5 7B Instruct43.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-humanities-chinese-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.