OpenCompass Agent - CIBench - English (CompassBench 2402): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 35 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)82.6
2GPT-3.5 Turbo76.1
3GLM-473.3
4Qwen 1.5 14B Chat64.3
5Qwen-72B-Chat62
6Qwen Max58.6
7Qwen-14B-Chat51.5
8Qwen 1.5 7B Chat51.1
9internlm2-chat-20B49.7
10Qwen-7B Chat49.4
11Mixtral 8x7B Instruct (v0.1)48.8
12WizardLM-70B-V1.044.2
13Mistral 7B Instruct (v0.2)43.9
14internlm2-chat-7B43.7
15Qwen 1.5 4B Chat43.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-cibench-english-compassbench-2402 · How It Works · Data refreshed daily, snapshot 2026-09-19.