OpenCompass LLM - Average - Chinese (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct69.3
2Claude 3.5 Sonnet (20240620)67.9
3GPT-4o (2024-05-13)67.6
4GLM-4 Plus66.4
5Step 2 16K65.5
6DeepSeek V2.565.1
7GPT-4o (2024-08-06)63.9
8Mistral Large 2 (Jul)63.2
9Gemini 1.5 Pro61.5
10GPT-4o Mini (2024-07-18)59.9
11Yi Large56.7
12Gemma 2 27B (IT)55.6
13Qwen 2.5 7B Instruct55
14Llama 3.1 405B Instruct FP852.5
15Mistral-Small-Instruct-240951.4

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-average-chinese-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.