OpenCompass Agent - CIBench - Chinese (CompassBench 2402): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 35 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)68.5
2GPT-3.5 Turbo66.9
3GLM-458.5
4Qwen 1.5 14B Chat57.5
5internlm2-chat-20B53.9
6Mixtral 8x7B Instruct (v0.1)49.6
7Qwen Max46.2
8Qwen-14B-Chat44.1
9internlm2-chat-7B43.6
10Qwen 1.5 4B Chat41.6
11Qwen-72B-Chat38.8
12Yi 34B (Chat)38.2
13Qwen 1.5 7B Chat37.5
14Mistral 7B Instruct (v0.2)36.8
15Qwen-7B Chat32.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-cibench-chinese-compassbench-2402 · How It Works · Data refreshed daily, snapshot 2026-09-19.