OpenCompass Code - Code QA - English (CompassBench 2504): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 28 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 05-06)83.1
2Grok 377.7
3Gemma 3 27B (IT)76.5
4Qwen 3 235B A22B (Thinking)74.8
5Qwen 3 32B (Thinking)73.3
6Qwen 3 235B A22B72.5
7Step 2 16K71.6
8Doubao-1.5-thinking-pro-25041571.6
9MiniMax-Text-0169.9
10DeepSeek V3 (0324)67.2
11GPT-4.1 (2025-04-14)65.4
12GPT-4.1 Mini63.7
13ERNIE-X1-Turbo-32K62.3
14Llama 4 Maverick Instruct59.8
15O4 Mini (High)59.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-code-qa-english-compassbench-2504 · How It Works · Data refreshed daily, snapshot 2026-09-19.