EvoEval Subtle — leaderboard

Metric: Pass@1 (%). Source: evo-eval.github.io. 51 models tracked.

Top models

#ModelScore
1GPT-4 Turbo82
2GPT-476
3Claude 3 Haiku65
4Claude 264
5deepseek-coder-6.7B-instruct61
6Gemini 1.0 Pro53
7deepseek-coder-1.3B-instruct53
8Phi-249
9Qwen-14B45
10Mixtral 8x7B Instruct41
11starcoder2-15B41
12gemma-7B40
13starcoder2-7B38
14starcoder37
15Qwen-7B36

Interactive version: theaggregate.ai/benchmark?slug=evoeval-subtle · How the rankings work · Data refreshed daily, snapshot 2026-07-22.