LongWebBench: leaderboard

Metric: Overall (self-reported). Source: benchmarklist.com. 13 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)7.22
2Claude Sonnet 4.5 (Thinking)6.74
3Gemini 3 Flash (Preview)6.53
4GPT-5.26.5
5Claude Opus 4.5 (20251101)6.43
6GLM-4.6V5.96
7Qwen 3 VL 235B A22B Instruct5.85
8Doubao-Seed-1.64.77
9Qwen 3 VL 8B Instruct3.95
10InternVL3-78B3.62
11GPT-4o3.53

Interactive version: theaggregate.ai/benchmark?slug=longwebbench · How It Works · Data refreshed daily, snapshot 2026-09-05.