OpenCompass Reasoning - Common Sense - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1OrionStar-Yi-34B-Chat31.8
2Qwen-14B-Chat25.6
3Qwen-72B-Chat23.8
4GPT-4 Turbo (Preview)20.6
5Llama 2 70B Chat20.2
6Yi 34B (Chat)20.2
7Qwen-7B Chat20.2
8Llama 2 13B Chat13.9
9Yi 6B (Chat)13.4
10Mistral 7B Instruct (v0.2)12.6
11Baichuan2-13B-Chat12.1
12Baichuan2-7B-Chat9.4
13WizardLM-13B-V1.27.2
14Llama 2 7B Chat6.7
15deepseek-llm-7B-chat3.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-sense-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.