OpenCompass Language - Content Summarization - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1Qwen-72B-Chat36.8
2OrionStar-Yi-34B-Chat31.5
3Llama 2 70B Chat30.4
4Llama 2 13B Chat30
5Mistral 7B Instruct (v0.2)29.9
6Baichuan2-7B-Chat29.8
7GPT-4 Turbo (Preview)29.6
8Qwen-14B-Chat29.6
9Baichuan2-13B-Chat29.5
10Llama 2 7B Chat29.4
11WizardLM-70B-V1.029.4
12WizardLM-13B-V1.229.3
13Qwen-7B Chat29.3
14Yi 34B (Chat)28.9
15deepseek-llm-7B-chat28.2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-content-summarization-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.