OpenCompass Code - HumanEval+ - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)70.1
2Qwen-72B-Chat54.3
3WizardLM-70B-V1.036.6
4Qwen-14B-Chat36
5Mistral 7B Instruct (v0.2)31.7
6Yi 34B (Chat)31.7
7Qwen-7B Chat31.7
8deepseek-llm-7B-chat30.5
9Llama 2 70B Chat28.7
10OrionStar-Yi-34B-Chat26.8
11WizardLM-13B-V1.220.7
12Baichuan2-13B-Chat16.5
13Baichuan2-7B-Chat14.6
14Llama 2 7B Chat12.8
15Yi 6B (Chat)11

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-humaneval-plus-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.