OpenCompass Code - Code QA - English (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)82.8
2Claude 3.5 Sonnet (20241022)66.5
3GPT-4o (2024-11-20)59.8
4Grok Beta58.2
5Qwen 2.5 72B Instruct57
6Yi Lightning56.1
7GLM-4 Plus55.5
8DeepSeek V2.552.7
9360gpt2-pro52.5
10Mistral Large 2 (Nov) Instruct (2411)52
11TeleChat251
12GPT-4o (2024-08-06)50
13Step 2 16K47.3
14Llama 3.1 405B Instruct FP847.1
15Qwen 2.5 7B Instruct42.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-code-qa-english-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.