OpenCompass Reasoning - Deductive - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)23.3
2Qwen-72B-Chat20.9
3Mistral 7B Instruct (v0.2)18.6
4OrionStar-Yi-34B-Chat18.6
5Qwen-14B-Chat16.3
6Llama 2 13B Chat13.9
7Llama 2 7B Chat11.6
8Yi 34B (Chat)11.6
9Baichuan2-13B-Chat7
10Qwen-7B Chat7
11Yi 6B (Chat)4.7
12deepseek-llm-7B-chat4.7
13Baichuan2-7B-Chat4.7
14Llama 2 70B Chat2.3
15WizardLM-70B-V1.00

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-deductive-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.