MobileGym-Bench - Deep-Dive Tasks: leaderboard

Metric: Success rate (%; 68 of the 256 test tasks, state-checked; open models: mean of four runs with re-sampled task parameters; proprietary models: one run (two for Gemini 3.1 Pro)). Source: arxiv.org. Saturation forecast: Around December 2026. 9 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)43.4
2Seed 2.0 Pro36.8
3Qwen 3.6 Plus32.4
4uitars-1.5-7B4.8
5Qwen 3 VL 4B Instruct1.5

Interactive version: theaggregate.ai/benchmark?slug=mobilegym-bench-deep-dive-tasks · How It Works · Data refreshed daily, snapshot 2026-09-25.