EvoEval Verbose — leaderboard

Metric: Pass@1 (%). Source: evo-eval.github.io. 51 models tracked.

Top models

#ModelScore
1GPT-4 Turbo79.27
2deepseek-coder-6.7B-instruct72.56
3Claude 3 Haiku71.34
4GPT-470.12
5Claude 266.46
6Gemini 1.0 Pro58.54
7deepseek-coder-1.3B-instruct57.32
8Phi-251.22
9Qwen-14B48.78
10starcoder2-15B46.34
11Mixtral 8x7B Instruct40.85
12Qwen-7B39.63
13starcoder2-7B37.8
14starcoder34.76
15gemma-7B33.54

Interactive version: theaggregate.ai/benchmark?slug=evoeval-verbose · How the rankings work · Data refreshed daily, snapshot 2026-07-22.