EvoEval — leaderboard

Metric: Pass@1 (%). Source: evo-eval.github.io. 51 models tracked.

Top models

#ModelScore
1GPT-4 Turbo68.63
2GPT-468.57
3Claude 3 Haiku56.96
4deepseek-coder-6.7B-instruct53.24
5Claude 251.68
6Gemini 1.0 Pro48.81
7deepseek-coder-1.3B-instruct40.96
8Phi-236.6
9Qwen-14B35.55
10starcoder2-15B32.82
11Mixtral 8x7B Instruct32.6
12starcoder2-7B27.87
13starcoder26.13
14gemma-7B25.29
15Qwen-7B24.16

Interactive version: theaggregate.ai/benchmark?slug=evoeval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.