OpenCompass Subjective - Reasoning (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 51 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)56.5
2GPT-4 Turbo55.5
3GPT-4 Turbo (Preview)50
4Claude 3 Opus49.8
5GLM-449.5
6Moonshot v1 8K47.8
7Qwen 1.5 110B Chat47.5
8DeepSeek V2 Chat41.2
9Qwen 1.5 72B Chat41
10Yi 34B (Chat)38
11Qwen-72B-Chat37
12Qwen 1.5 14B Chat34.2
13Llama 3 70B Instruct34
14GPT-3.5 Turbo31
15Qwen-14B-Chat31

Interactive version: theaggregate.ai/benchmark?slug=opencompass-subjective-reasoning-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.