OpenCompass Reasoning - Inductive - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)39.4
2OrionStar-Yi-34B-Chat34.1
3Qwen-72B-Chat31.2
4Qwen-7B Chat30.2
5Yi 34B (Chat)29.1
6Qwen-14B-Chat27.5
7WizardLM-70B-V1.027.4
8Baichuan2-7B-Chat26.9
9Baichuan2-13B-Chat26.3
10deepseek-llm-7B-chat24.7
11Yi 6B (Chat)24.6
12WizardLM-13B-V1.221.9
13Llama 2 13B Chat11.5
14Mistral 7B Instruct (v0.2)5.5
15Llama 2 7B Chat3.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-inductive-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.