HumanEval+: leaderboard

HumanEval+ code-generation leaderboard from EvalPlus.

Metric: HumanEval+ pass@1 (self-reported). Source: benchmarklist.com. Status: saturated. 24 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)89
2GPT-4o (2024-08-06)87.2
3Qwen 2.5 Coder 32B Instruct87.2
4GPT-4 Turbo86.6
5GPT-4o Mini (2024-07-18)83.5
6Claude 3.5 Sonnet (20240620)81.7
7Grok Beta80.5
8Gemini 1.5 Pro (002)79.3
9GPT-479.3
10Claude 3 Opus77.4
11OpenCoder-8B-Instruct77.4
12Gemini 1.5 Flash (002)75.6
13Codestral-22B-v0.173.8
14Llama 3 70B Instruct72
15Mixtral 8x22B Instruct (v0.1)72

Interactive version: theaggregate.ai/benchmark?slug=humaneval-plus · How It Works · Data refreshed daily, snapshot 2026-09-05.