WebApp1K Duo — leaderboard

React web app code generation benchmark (hard): dual-task combinations requiring models to implement two features simultaneously, testing compositional code generation.

Metric: Pass@1 (%). Source: huggingface.co. Status: saturation imminent. 49 models tracked.

Top models

#ModelScore
1GPT-579.38
2Claude Sonnet 4.578.4
3Claude Opus 4.1 (20250805)76.9
4GPT-5.176.5
5Claude Opus 4 (20250514)76.3
6Claude Opus 4.5 (20251101)76.3
7Claude 3.5 Sonnet (20241022)75
8GPT-OSS-120B75
9Gemini 3 Pro (Preview)75
10GPT-5 Codex75
11GPT-5.1 Codex74.3
12O4 Mini72.6
13Grok 4.1 Fast (Reasoning)71.6
14Kimi K2 (Thinking)70.7
15Gemini 2.5 Pro (Preview 06-05)70.4

Interactive version: theaggregate.ai/benchmark?slug=webapp1k-duo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.