OpenCompass LLM - Reasoning - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)43.9
2OrionStar-Yi-34B-Chat39.1
3Yi 34B (Chat)37.4
4Baichuan2-13B-Chat29.4
5Qwen-14B-Chat28.2
6Llama 2 70B Chat28.1
7Qwen-72B-Chat27.1
8Llama 2 13B Chat23.3
9Qwen-7B Chat22.6
10Llama 2 7B Chat22.2
11Baichuan2-7B-Chat20.5
12Mistral 7B Instruct (v0.2)20.4
13Yi 6B (Chat)18.9
14WizardLM-13B-V1.213.7
15WizardLM-70B-V1.09.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.