OpenCompass Code - HumanEval-X (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)55.9
2WizardLM-70B-V1.034
3Qwen-72B-Chat33.5
4deepseek-llm-7B-chat33.2
5Qwen-14B-Chat29.9
6Mistral 7B Instruct (v0.2)27.1
7OrionStar-Yi-34B-Chat26
8Yi 34B (Chat)24.6
9Qwen-7B Chat24.4
10WizardLM-13B-V1.223.1
11Llama 2 70B Chat20.2
12Baichuan2-13B-Chat18.3
13Baichuan2-7B-Chat15.4
14Llama 2 13B Chat12.9
15Llama 2 7B Chat10.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-humaneval-x-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.