GMA - Subtask Completion: leaderboard

Metric: Average score (%; share of each task's programmatically verified subtasks completed, averaged over tasks; 300 tasks in seven custom Android applications, vision-only agent seeing raw screenshots (two most recent kept), MobileWorld action space plus call_user and answer, Qwen3.7-Plus user simulator, 150-step budget; all four difficulty tiers). Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Qwen 3.8 Max80.35
2GPT-5.6 Sol75.86
3Seed 2.1 Pro74.42
4Claude Opus 4.772.33
5GPT-5.571.14
6Claude Sonnet 4.668.13
7Gemini 3.5 Flash65.91
8Qwen 3.7 Plus63.78

Interactive version: theaggregate.ai/benchmark?slug=gma-subtask-completion · How It Works · Data refreshed daily, snapshot 2026-09-29.