OpenCompass LLM - Reasoning - Chinese (CompassBench 2407): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 36 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)56.6
2Claude 3.5 Sonnet (20240620)52.9
3Qwen 2 72B Instruct51.2
4Mistral Large49.1
5Qwen 1.5 110B Chat48.9
6DeepSeek V2 Chat (0628)48.3
7Mistral Large 2 (Jul)47.5
8Yi Large46.1
9GLM-4 (0520)45.7
10Moonshot v1 8K45.4
11GPT-4o Mini (2024-07-18)44.3
12Gemma 2 27B (IT)42.1
13Qwen 2 7B Instruct41.5
14GLM-4 9B Chat38.6
15Gemma 2 9B (IT)38.4

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-chinese-compassbench-2407 · How It Works · Data refreshed daily, snapshot 2026-09-19.