OpenCompass Language - Content Critique - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)50
2OrionStar-Yi-34B-Chat42
3Llama 2 70B Chat38
4Yi 34B (Chat)32
5Qwen-14B-Chat24
6Qwen-72B-Chat22
7Llama 2 13B Chat18
8WizardLM-13B-V1.216
9Baichuan2-13B-Chat16
10Llama 2 7B Chat10
11Mistral 7B Instruct (v0.2)8
12WizardLM-70B-V1.06
13Qwen-7B Chat4
14Yi 6B (Chat)2
15deepseek-llm-7B-chat2

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-content-critique-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.