OpenCompass Code - Execution - English (CompassBench 2501): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 40 models tracked.

Top models

#ModelScore
1O1 (2024-12-17)31.1
2DeepSeek R130.4
3Gemini 2.0 Pro (Preview 02-05)29.1
4Qwen 2.5 Max29.1
5O3 Mini (2025-01-31)28.4
6GPT-4o (2024-11-20)28.4
7DeepSeek V327.7
8O1 Mini (2024-09-12)25.7
9Gemini 2.0 Flash (001)25.7
10Llama 3.1 405B Instruct FP825
11GPT-4o Mini (2024-07-18)24.3
12Mistral Large 2 (Nov) Instruct (2411)24.3
13MiniMax-Text-0124.3
14Qwen 2.5 72B Instruct23.6
15QwQ 32B-Preview23.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-execution-english-compassbench-2501 · How It Works · Data refreshed daily, snapshot 2026-09-19.