OpenCompass Agent - T-Eval - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)86.1
2Yi 34B (Chat)70.8
3Qwen-72B-Chat65.6
4Qwen-14B-Chat63.6
5WizardLM-13B-V1.258.6
6Baichuan2-7B-Chat58.5
7Llama 2 70B Chat58
8Qwen-7B Chat57.5
9Yi 6B (Chat)54.1
10Baichuan2-13B-Chat53.6
11deepseek-llm-7B-chat50.3
12Llama 2 13B Chat48.7
13OrionStar-Yi-34B-Chat47.5
14WizardLM-70B-V1.039.6
15Mistral 7B Instruct (v0.2)39.3

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-t-eval-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.