WebDev Arena — leaderboard

Code Arena WebDev ranking from LMArena. Models generate web apps from prompts and are ranked by human preference votes; this project ingests the corresponding webdev_arena_external.csv feed from Epoch AI benchmark data.

Metric: Arena Score. Source: arena.ai. Status: saturation imminent. 81 models tracked.

Top models

#ModelScore
1GLM-5.2 (Max)1593.25
2Claude Opus 4.71562.39
3Claude Opus 4.61555.35
4Claude Opus 4.81545.05
5Qwen 3.7 Max1540.77
6GLM-5.11534
7MiniMax-M31527.75
8Kimi K2.61526
9Claude Sonnet 4.61522.86
10Muse Spark1512.53
11Claude Opus 4.5 (20251101) (Thinking 32K)1512
12GPT-5.5 (xHigh)1504.74
13Qwen 3.6 Max Preview1485.57
14GPT-5.2 (High)1480
15Kimi K2.7 Code1479.2

Interactive version: theaggregate.ai/benchmark?slug=webdev-arena · How the rankings work · Data refreshed daily, snapshot 2026-07-22.