OpenCompass Code - HumanEval+ - English (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GPT-4 Turbo79.3
2GPT-4o (2024-05-13)70.1
3Mixtral 8x22B Instruct (v0.1)69.5
4DeepSeek V2 Chat67.7
5Llama 3 70B Instruct65.8
6Moonshot v1 8K65.2
7Claude 3 Opus64.6
8Yi 1.5 34B Chat60.4
9Qwen 1.5 110B Chat60.4
10Yi-1.5-9B Chat59.8
11internlm2-chat-20B59.1
12GPT-3.5 Turbo57.9
13Yi-1.5-6B-Chat57.9
14Command-R+54.9
15Qwen 1.5 72B Chat53.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-humaneval-plus-english-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.