OpenCompass Agent - CIBench - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)76.2
2Qwen-72B-Chat45.6
3Qwen-14B-Chat42.5
4Yi 34B (Chat)36.3
5OrionStar-Yi-34B-Chat34.8
6Mistral 7B Instruct (v0.2)33.5
7Qwen-7B Chat33.4
8deepseek-llm-7B-chat28
9WizardLM-70B-V1.026
10Llama 2 70B Chat21.1
11Yi 6B (Chat)20.7
12Llama 2 7B Chat19
13Llama 2 13B Chat18.8
14Baichuan2-7B-Chat15
15WizardLM-13B-V1.214.4

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-cibench-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.