OpenCompass Code - Execution - Chinese (CompassBench 2501): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 40 models tracked.

Top models

#ModelScore
1O3 Mini (2025-01-31)31.1
2O1 (2024-12-17)30.4
3DeepSeek R128.4
4Qwen 2.5 Max25.7
5Gemini 2.0 Pro (Preview 02-05)25
6GLM-4 Plus23.6
7Qwen 2.5 72B Instruct23
8O1 Mini (2024-09-12)23
9Claude 3.5 Sonnet (20241022)22.3
10GPT-4o Mini (2024-07-18)22.3
11GPT-4o (2024-11-20)21.6
12Llama 3.1 405B Instruct FP820.9
13DeepSeek V320.3
14Doubao-1.5-pro-32k-25011520.3
15Gemini 2.0 Flash (001)19.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-execution-chinese-compassbench-2501 · How It Works · Data refreshed daily, snapshot 2026-09-19.