Vellum - HumanEval — leaderboard

Vellum's independently-run HumanEval coding evaluation. Function completion tasks measuring code generation ability.

Metric: Pass@1 (%). Source: www.vellum.ai. Status: saturation imminent. 44 models tracked.

Top models

#ModelScore
1Claude Mythos 595.5
2Claude Fable 595
3Claude Opus 4.888.6
4Claude Opus 4.787.6
5Claude Sonnet 585.2
6Claude Sonnet 4.582
7Claude Opus 4.580.9
8Claude Opus 4.680.8
9Gemini 3.1 Pro (Preview)80.6
10DeepSeek V4 Pro80.6
11MiniMax-M380.5
12Kimi K2.680.2
13GPT-5.280
14Claude Sonnet 4.679.6
15DeepSeek V4 Flash79

Interactive version: theaggregate.ai/benchmark?slug=vellum-humaneval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.