OpenCompass LLM - Reasoning - Chinese (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GPT-4 Turbo58.6
2GLM-453.8
3GPT-4o (2024-05-13)52.4
4Qwen 1.5 14B Chat51.8
5DeepSeek V2 Chat49
6Qwen 1.5 32B Chat48.9
7Qwen 1.5 72B Chat47.8
8Yi Large47.8
9Qwen 1.5 110B Chat45.7
10Moonshot v1 8K45.4
11Mistral Large44.8
12Claude 3 Opus43.6
13Yi 1.5 34B Chat41.8
14Command-R+40.6
15Llama 3 70B Instruct39.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-chinese-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.