OpenCompass Agent - CIBench - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)80.5
2Qwen-72B-Chat50.6
3Qwen-14B-Chat44.6
4Qwen-7B Chat42
5deepseek-llm-7B-chat39.3
6Mistral 7B Instruct (v0.2)37.8
7Yi 34B (Chat)36.7
8WizardLM-70B-V1.035.9
9OrionStar-Yi-34B-Chat33.9
10Yi 6B (Chat)29.7
11Llama 2 70B Chat26.9
12WizardLM-13B-V1.225.4
13Baichuan2-7B-Chat23.4
14Baichuan2-13B-Chat22
15Llama 2 7B Chat19.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-cibench-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.