OpenCompass Subjective - Conversation (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)69.3
2Qwen 1.5 110B Chat59.4
3GPT-4 Turbo54.9
4GLM-454.2
5Yi 1.5 34B Chat51.6
6DeepSeek V2 Chat48.1
7Yi Large43.9
8internlm2-chat-20B41.7
9internlm2-chat-7B40.9
10Moonshot v1 8K40.7
11Claude 3 Opus40.6
12Command-R+40.3
13Qwen 1.5 72B Chat38.4
14Qwen 1.5 14B Chat38.3
15Llama 3 70B Instruct38.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-subjective-conversation-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.