OpenCompass Language - Content Summarization - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1Qwen-14B-Chat32
2GPT-4 Turbo (Preview)29.8
3OrionStar-Yi-34B-Chat29.7
4Qwen-72B-Chat28.8
5Qwen-7B Chat28.6
6WizardLM-13B-V1.224.2
7Baichuan2-7B-Chat24.1
8Baichuan2-13B-Chat23.9
9WizardLM-70B-V1.022.7
10Yi 6B (Chat)21.3
11Yi 34B (Chat)20
12deepseek-llm-7B-chat6
13Llama 2 70B Chat1.3
14Mistral 7B Instruct (v0.2)0.7
15Llama 2 7B Chat0.5

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-content-summarization-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.