OpenCompass Subjective - Language (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 51 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)57.8
2Claude 3 Opus56.2
3Qwen 1.5 110B Chat52
4Moonshot v1 8K50.5
5DeepSeek V2 Chat50.2
6GPT-4 Turbo (Preview)50
7Qwen 1.5 72B Chat46.5
8GPT-4 Turbo46.2
9GLM-445.2
10internlm2-chat-7B42.2
11Yi 34B (Chat)41.5
12internlm2-chat-20B40.5
13Qwen 1.5 14B Chat38.2
14Qwen 1.5 7B Chat36.2
15Llama 3 70B Instruct34

Interactive version: theaggregate.ai/benchmark?slug=opencompass-subjective-language-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.