OpenCompass Reasoning - Abductive - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)88.8
2OrionStar-Yi-34B-Chat77.5
3Yi 34B (Chat)69.4
4WizardLM-70B-V1.060.2
5deepseek-llm-7B-chat51
6Qwen-14B-Chat39.8
7Baichuan2-7B-Chat34.7
8WizardLM-13B-V1.231.6
9Qwen-72B-Chat29.6
10Llama 2 13B Chat28.6
11Mistral 7B Instruct (v0.2)22.4
12Qwen-7B Chat22.4
13Llama 2 7B Chat16.3
14Baichuan2-13B-Chat11.2
15Llama 2 70B Chat10.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-abductive-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.