LongWebBench - Single-Image Input: leaderboard

Metric: Structural fidelity overall score (0-10): macro-average over seven site categories for full-page webpages generated from one long screenshot of each of 490 real webpages: a GPT-4o evaluator (gpt-4o-2024-11-20, deterministic) compares the rendered page with the reference on page scale, global layout, section hierarchy, visual styling (0.8 judge plus 0.2 DINO similarity) and information density; inputs the model or API rejects score 0; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 13 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)6.77
2GPT-5.26.5
3Gemini 3 Flash (Preview)6.36
4GLM-4.6V5.66
5Qwen 3 VL 235B A22B Instruct5.1
6Claude Opus 4.5 (20251101)3.84
7Claude Sonnet 4.5 (Thinking)3.81
8Seed-1.63.66
9Qwen 3 VL 8B Instruct3.47
10InternVL3-78B3.4
11GPT-4o3.23

Interactive version: theaggregate.ai/benchmark?slug=longwebbench-single-image-input · How It Works · Data refreshed daily, snapshot 2026-09-29.