OpenCompass Code - Execution - English (CompassBench 2507): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Grok 437.2
2O4 Mini (2025-04-16) (High)31.8
3O3 (2025-04-16) (High)29.7
4DeepSeek V3 (0324)29.1
5Qwen 3 235B A22B 2507 (Thinking)29.1
6GLM-4.528.4
7Gemini 2.5 Pro27.7
8DeepSeek R1 052827.7
9Hunyuan-T1-2025071127.7
10GPT-4.1 (2025-04-14)27
11Claude Sonnet 4 (Thinking)27
12Kimi K226.4
13GLM 4.5 Air26.4
14Qwen 3 235B A22B 2507 Instruct26.4
15Doubao-Seed-1.6-thinking-25071526.4

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-execution-english-compassbench-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.