OpenCompass Language - Content Critique - English (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GPT-4 Turbo58
2Qwen 1.5 32B Chat56
3GLM-456
4Llama 3 70B Instruct54
5GPT-4o (2024-05-13)54
6Yi Large54
7Qwen 1.5 72B Chat52
8Qwen 1.5 110B Chat52
9Yi-1.5-9B Chat50
10internlm2-chat-20B48
11DeepSeek V2 Chat48
12Yi 1.5 34B Chat46
13Moonshot v1 8K44
14Llama 3 8B Instruct42
15Claude 3 Opus40

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-content-critique-english-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.