OpenCompass Code - Execution - English (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1O4 Mini (High)32.4
2O3 Mini (High)31.1
3Qwen 3 235B A22B (Thinking)31.1
4GPT-4.1 (2025-04-14)30.4
5DeepSeek V3 (0324)29.7
6GPT-4.1 Mini29.1
7Claude 3.7 Sonnet (Thinking)29.1
8Qwen 3 235B A22B28.4
9Doubao-1.5-thinking-pro-25041527.7
10DeepSeek R127
11Qwen 3 32B (Thinking)27
12Gemini 2.5 Pro (Preview 05-06)26.4
13GLM-4 32B (0414)25.7
14Llama 4 Maverick Instruct25
15Llama 4 Scout Instruct24.3

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-execution-english-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.