OpenCompass Reasoning - Common Sense - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1OrionStar-Yi-34B-Chat47.1
2Qwen-72B-Chat33.3
3Yi 34B (Chat)24.5
4GPT-4 Turbo (Preview)22.2
5Qwen-7B Chat21.1
6Yi 6B (Chat)16.5
7Qwen-14B-Chat16.1
8Baichuan2-7B-Chat11.9
9Baichuan2-13B-Chat11.5
10Mistral 7B Instruct (v0.2)10
11Llama 2 7B Chat5.8
12Llama 2 13B Chat5.8
13WizardLM-70B-V1.05.8
14deepseek-llm-7B-chat5.8
15Llama 2 70B Chat3.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-sense-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.