OpenCompass Code - Execution - Chinese (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Grok 432.4
2DeepSeek V3 (0324)31.1
3O3 (2025-04-16) (High)29.1
4Gemini 2.5 Pro27.7
5Qwen 3 235B A22B 2507 (Thinking)27
6GLM-4.527
7Hunyuan-T1-2025071127
8GPT-4.1 (2025-04-14)26.4
9GLM 4.5 Air26.4
10Qwen 3 235B A22B 2507 Instruct26.4
11DeepSeek R1 052826.4
12MiniMax M1 80k26.4
13Kimi K225.7
14Llama 4 Maverick Instruct25.7
15O4 Mini (2025-04-16) (High)25.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-execution-chinese-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.