OpenUI Generative UI Benchmark: leaderboard

Metric: Structural Validity (%). Source: www.openui.com. 30 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol99.5
2Grok 4.699.5
3Claude Opus 4.898.9
4Gemini 3.7 Flash98.9
5GPT-5.6 Terra98.4
6Claude Sonnet 598.4
7Kimi K396.2
8Claude Opus 596.2
9Muse Spark 1.296.2
10Claude Sonnet 4.692.9
11GLM-5.390.8
12Inkling Small88.6
13DeepSeek V4 Flash85.8
14DeepSeek V4 Pro84.2
15GPT-5.6 Luna83.7

Interactive version: theaggregate.ai/benchmark?slug=openui-generative-ui-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.