OpenCompass LLM - Reasoning (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)48.2
2OrionStar-Yi-34B-Chat44.3
3Yi 34B (Chat)37.6
4Qwen-72B-Chat31.4
5Qwen-14B-Chat29.1
6Baichuan2-13B-Chat23.9
7Qwen-7B Chat23.6
8Baichuan2-7B-Chat21.4
9Llama 2 13B Chat19.7
10WizardLM-70B-V1.018.5
11Yi 6B (Chat)17.9
12Mistral 7B Instruct (v0.2)17.8
13Llama 2 70B Chat17.3
14deepseek-llm-7B-chat16.2
15WizardLM-13B-V1.216

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.