OpenCompass Agent - T-Eval - Chinese (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1Mixtral 8x22B Instruct (v0.1)85.4
2GPT-4 Turbo84.9
3Mistral Large84.9
4Yi Large84.6
5Claude 3 Opus83.9
6Command-R+83.1
7GPT-4o (2024-05-13)81.9
8Yi 1.5 34B Chat79.4
9Qwen 1.5 32B Chat75.9
10DeepSeek V2 Chat75.6
11Mistral 7B Instruct (v0.3)74.3
12GLM-474.2
13GPT-3.5 Turbo72.5
14DeepSeek-V2-Lite-Chat71.2
15Llama 3 70B Instruct70

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-t-eval-chinese-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.