OpenCompass Code - HumanEval - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)68.9
2Qwen-72B-Chat49.4
3deepseek-llm-7B-chat42.1
4WizardLM-70B-V1.036
5Qwen-14B-Chat35.4
6Mistral 7B Instruct (v0.2)31.1
7Yi 34B (Chat)29.3
8Qwen-7B Chat28.1
9Llama 2 70B Chat24.4
10OrionStar-Yi-34B-Chat24.4
11WizardLM-13B-V1.220.7
12Baichuan2-7B-Chat17.1
13Llama 2 13B Chat12.8
14Llama 2 7B Chat11.6
15Yi 6B (Chat)11

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-humaneval-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.