EvoEval Combine — leaderboard

Metric: Pass@1 (%). Source: evo-eval.github.io. 51 models tracked.

Top models

#ModelScore
1GPT-453
2GPT-4 Turbo45
3Claude 3 Haiku25
4Gemini 1.0 Pro23
5Claude 219
6deepseek-coder-6.7B-instruct18
7Phi-214
8Qwen-14B13
9Mixtral 8x7B Instruct9
10deepseek-coder-1.3B-instruct9
11starcoder2-15B5
12Qwen-7B4
13Mistral 7B Instruct3
14Mistral 7B3
15gemma-7B2

Interactive version: theaggregate.ai/benchmark?slug=evoeval-combine · How the rankings work · Data refreshed daily, snapshot 2026-07-22.