OpenCompass Subjective - Reasoning - Chinese (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)57.8
2GPT-4 Turbo57
3GLM-444.1
4Claude 3 Opus43.8
5Moonshot v1 8K42.1
6Yi Large40.1
7DeepSeek V2 Chat39.6
8Yi 1.5 34B Chat37
9Qwen 1.5 110B Chat36.3
10Llama 3 70B Instruct33.2
11Mistral Large32.2
12internlm2-chat-20B30.9
13Qwen 1.5 72B Chat30.7
14Qwen 1.5 32B Chat29.1
15Yi-1.5-9B Chat27.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-subjective-reasoning-chinese-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.