WebTestBench - Checklist Coverage: leaderboard

Metric: Checklist coverage (%): share of gold test items the agent's generated checklist covers, on 100 generated web applications, WebTester agents on Claude Code with Playwright MCP, predicted test items matched to the human gold checklist by a Qwen3.5-27B judge; higher is better. Source: arxiv.org. Saturation forecast: Around June 2028. 10 models tracked.

Top models

#ModelScoreOverall rank
1Step 3.5 Flash66#262
2Claude Sonnet 4.563.7#138
3MiMo-V2-Flash63.5#359
4Claude Opus 4.563.2#79
5GPT-5.163.1#131
6GLM-563.1#137
7GLM-4.761.1#185
8GPT-5.261#105
9Qwen3 Coder Next60.4#321
10MiniMax-M2.160.1#283

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=webtestbench-checklist-coverage · How It Works · Data refreshed daily, snapshot 2026-10-11.