Asuka-Bench (OpenHands): leaderboard

Metric: Cumulative weighted task pass rate (%) after three feedback rounds under the OpenHands agent framework, on 50 web-app tasks from underspecified queries verified by a browser UI agent; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 7 models tracked.

Top models

#ModelScore
1GPT-5.4 (Medium)90.1
2Kimi K2.686.6
3Gemini 3.1 Pro (Preview)80.7
4GLM-575.3
5Qwen 3.5 Plus72.9
6MiniMax-M2.770.7
7Seed 2.0 Pro53.7

Interactive version: theaggregate.ai/benchmark?slug=asuka-bench-openhands · How It Works · Data refreshed daily, snapshot 2026-09-29.