EvalPlus (HumanEval+ / MBPP+): leaderboard

Enhanced versions of HumanEval and MBPP with 80x and 35x more test cases respectively. Measures Pass@k for single-function code generation.

Metric: Pass@1 avg (%). Source: evalplus.github.io. 125 models tracked.

Top models

#ModelScore
1GPT-4 Turbo86.6
2O1 Preview (2024-09-12)84.6
3O1 Mini (2024-09-12)83.9
4Qwen 2.5 Coder 32B Instruct82.1
5GPT-4o (2024-08-06)79.7
6GPT-479.3
7Claude 3.5 Sonnet (20240620)78
8GPT-4o Mini (2024-07-18)77.8
9GPT-4 Turbo (Preview)77.5
10Gemini 1.5 Pro (002)76.9
11Claude 3 Opus75.3
12OpenCoder-8B-Instruct74.4
13CodeQwen1.5-7B Chat73.8
14Grok Beta73
15Gemini 1.5 Flash (002)71.5

Interactive version: theaggregate.ai/benchmark?slug=evalplus-humaneval-plus-mbpp-plus-1e45jvt · How It Works · Data refreshed daily, snapshot 2026-10-09.