OpenCompass Language - Content Critique - Chinese (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GLM-462
2GPT-4o (2024-05-13)58
3GPT-4 Turbo58
4DeepSeek V2 Chat54
5Moonshot v1 8K52
6Yi 1.5 34B Chat52
7Qwen 1.5 110B Chat52
8Llama 3 70B Instruct50
9Qwen 1.5 72B Chat50
10Yi Large50
11Command-R+48
12Qwen 1.5 14B Chat44
13Qwen 1.5 32B Chat44
14Mistral Large42
15Mixtral 8x22B Instruct (v0.1)42

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-content-critique-chinese-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.