Web-Bench — leaderboard

Web development benchmark testing code generation for realistic web applications with Pass@1 evaluation across multiple frameworks.

Metric: Pass@1 (%). Source: huggingface.co. Status: saturation imminent. 48 models tracked.

Top models

#ModelScore
1Claude Opus 4 (20250514)28
2Claude Opus 4 (20250514) (Thinking)25.6
3Gemini 2.5 Pro (Preview 06-05)25.3
4Claude 3.7 Sonnet (20250219) (Thinking)25.1
5Claude Sonnet 4 (20250514)25.1
6Claude Sonnet 4 (20250514) (Thinking)24.3
7Claude 3.5 Sonnet (20241022)23
8Claude 3.7 Sonnet (20250219)22.5
9Claude 3.5 Sonnet (20240620)22
10GPT-4.121.1
11GPT-4.1 Mini20.8
12Gemini 2.5 Pro (Preview 05-06)20.8
13GPT-4o17.2
14DeepSeek R1 052817.1
15DeepSeek Coder V216.7

Interactive version: theaggregate.ai/benchmark?slug=web-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.