Asuka-Bench (Claude Code): leaderboard

Metric: Cumulative weighted task pass rate (%) after three feedback rounds under the Claude Code agent framework, on 50 web-app tasks from underspecified queries verified by a browser UI agent; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.689.4
2GPT-5.4 (Medium)88.1
3GLM-576.6
4MiniMax-M2.776.4
5Qwen 3.5 Plus70.1
6Seed 2.0 Pro51.8

Interactive version: theaggregate.ai/benchmark?slug=asuka-bench-claude-code · How It Works · Data refreshed daily, snapshot 2026-09-29.