OpenCompass Knowledge - Humanities - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)68.2
2Claude 3.5 Sonnet (20241022)65.9
3Step 2 16K65.1
4GPT-4o (2024-08-06)62.8
5Llama 3.1 405B Instruct FP862
6Yi Lightning62
7Mistral Large 2 (Nov) Instruct (2411)59.7
8Llama 3.1 70B Instruct58.9
9Qwen 2.5 72B Instruct58.1
10GLM-4 Plus57.4
11DeepSeek V2.555.8
12TeleChat255.8
13360gpt2-pro53.5
14O1 Mini (2024-09-12)49.6
15GLM-4 9B Chat45.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-knowledge-humanities-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.