EvalPlus (HumanEval+ & MBPP+) — leaderboard

Metric: Pass@1 avg (%). Source: evalplus.github.io. 125 models tracked.

Top models

#ModelScore
1GPT-4 Turbo86.6
2O1 Mini (2024-09-12)83.9
3Qwen 2.5 Coder 32B Instruct82.1
4GPT-4o (2024-08-06)79.7
5GPT-479.3
6Claude 3.5 Sonnet (20240620)78
7GPT-4o Mini (2024-07-18)77.8
8GPT-4 Turbo (Preview)77.5
9Gemini 1.5 Pro (002)76.9
10Claude 3 Opus75.3
11OpenCoder-8B-Instruct74.4
12Grok Beta73
13Gemini 1.5 Flash (002)71.5
14Llama 3 70B Instruct70.5
15GPT-3.5 Turbo (1106)70.2

Interactive version: theaggregate.ai/benchmark?slug=evalplus-humaneval-plus-mbpp-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.