OpenCompass LLM - Reasoning - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)52.5
2OrionStar-Yi-34B-Chat49.4
3Yi 34B (Chat)37.9
4Qwen-72B-Chat35.6
5Qwen-14B-Chat30
6WizardLM-70B-V1.027.2
7Qwen-7B Chat24.6
8deepseek-llm-7B-chat23.1
9Baichuan2-7B-Chat22.4
10Baichuan2-13B-Chat18.5
11WizardLM-13B-V1.218.3
12Yi 6B (Chat)16.9
13Llama 2 13B Chat16.1
14Mistral 7B Instruct (v0.2)15.2
15Llama 2 7B Chat7.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.