OpenCompass LLM - Agent - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)83.3
2Qwen-72B-Chat58.1
3Qwen-14B-Chat54.1
4Yi 34B (Chat)53.8
5Qwen-7B Chat49.7
6deepseek-llm-7B-chat44.8
7Llama 2 70B Chat42.5
8WizardLM-13B-V1.242
9Yi 6B (Chat)41.9
10Baichuan2-7B-Chat41
11OrionStar-Yi-34B-Chat40.7
12Mistral 7B Instruct (v0.2)38.5
13WizardLM-70B-V1.037.8
14Baichuan2-13B-Chat37.8
15Llama 2 13B Chat33.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-agent-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.