OpenCompass Code - Code QA - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)82.4
2GPT-4o (2024-11-20)68.9
3Claude 3.5 Sonnet (20241022)68.8
4Yi Lightning62.3
5Qwen 2.5 72B Instruct60.3
6DeepSeek V2.560.3
7360gpt2-pro57.7
8GLM-4 Plus57.5
9Grok Beta57
10Mistral Large 2 (Nov) Instruct (2411)52.6
11TeleChat252.2
12Step 2 16K50.7
13GPT-4o (2024-08-06)50
14Qwen 2.5 7B Instruct44.6
15Mistral-Small-Instruct-240944.3

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-code-qa-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.