OpenCompass Agent - T-Eval - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)84.9
2Yi 34B (Chat)70.8
3Qwen-72B-Chat70.8
4Qwen-14B-Chat68.7
5Qwen-7B Chat61.1
6Baichuan2-13B-Chat60.2
7Yi 6B (Chat)59.1
8Baichuan2-7B-Chat53.6
9OrionStar-Yi-34B-Chat52.8
10Llama 2 70B Chat48.4
11Llama 2 13B Chat44.9
12deepseek-llm-7B-chat44.5
13WizardLM-70B-V1.041.1
14WizardLM-13B-V1.241
15Mistral 7B Instruct (v0.2)38.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-t-eval-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.