EvalPlus: leaderboard

EvalPlus leaderboard aggregating HumanEval+ and MBPP+ code-generation pass@1 scores.

Metric: EvalPlus Avg. (self-reported). Source: benchmarklist.com. Status: saturated. 25 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)83.9
2Qwen 2.5 Coder 32B Instruct82.1
3GPT-4o (2024-08-06)79.7
4Claude 3.5 Sonnet (20240620)78
5GPT-4o Mini (2024-07-18)77.85
6GPT-4 Turbo (Preview)77.5
7Gemini 1.5 Pro (002)76.95
8Claude 3 Opus75.35
9OpenCoder-8B-Instruct74.4
10Grok Beta73.05
11Gemini 1.5 Flash (002)71.55
12Llama 3 70B Instruct70.5
13GPT-3.5 Turbo (1106)70.2
14Claude 3 Haiku68.85
15deepseek-coder-6.7B-instruct68.45

Interactive version: theaggregate.ai/benchmark?slug=evalplus · How It Works · Data refreshed daily, snapshot 2026-09-05.