OpenCompass Language - Content Critique - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)54
2OrionStar-Yi-34B-Chat48
3Yi 34B (Chat)44
4WizardLM-70B-V1.044
5Qwen-72B-Chat44
6Qwen-14B-Chat34
7WizardLM-13B-V1.228
8Yi 6B (Chat)26
9Llama 2 13B Chat26
10deepseek-llm-7B-chat26
11Baichuan2-13B-Chat16
12Llama 2 70B Chat14
13Qwen-7B Chat14
14Baichuan2-7B-Chat12
15Mistral 7B Instruct (v0.2)10

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-content-critique-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.