OpenCompass Reasoning - Deductive - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)59.5
2Qwen-72B-Chat48.2
3OrionStar-Yi-34B-Chat38.9
4Qwen-14B-Chat36.5
5Yi 34B (Chat)28.7
6Baichuan2-13B-Chat25.1
7Qwen-7B Chat24.9
8Mistral 7B Instruct (v0.2)22.9
9Llama 2 13B Chat18.6
10Yi 6B (Chat)18.2
11WizardLM-13B-V1.217.1
12Baichuan2-7B-Chat16.2
13WizardLM-70B-V1.015.6
14deepseek-llm-7B-chat11
15Llama 2 70B Chat10.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-deductive-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.