OpenCompass Agent - CIBench - Chinese (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1Claude 3 Opus77.5
2Mistral Large75.2
3GPT-3.5 Turbo66.9
4GLM-466.3
5Yi Large66.1
6Qwen 1.5 32B Chat65.5
7Command-R+62.3
8Yi 1.5 34B Chat62
9DBRX60.7
10Qwen 1.5 14B Chat60.3
11GPT-4o (2024-05-13)60.2
12GPT-4 Turbo60.1
13Llama 3 70B Instruct57.3
14DeepSeek V2 Chat56.8
15Qwen 1.5 110B Chat54.3

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-cibench-chinese-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.