OpenCompass Reasoning - Social - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1Yi Lightning68.6
2GLM-4 Plus67.1
3GPT-4o (2024-11-20)65
4O1 Mini (2024-09-12)62.9
5Grok Beta60.1
6TeleChat259.4
7DeepSeek V2.558.2
8Claude 3.5 Sonnet (20241022)56.9
9Qwen 2.5 72B Instruct56.6
10360gpt2-pro56
11Step 2 16K55.8
12Mistral Large 2 (Nov) Instruct (2411)51.1
13GPT-4o (2024-08-06)50
14Qwen 2.5 7B Instruct42.8
15Llama 3.1 405B Instruct FP840.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-social-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.