MobilePA-Bench - Memory Usage: leaderboard

Metric: End-to-end success (%). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1Qwen 3.8 Max64.63
2Kimi K363.56
3Gemini 3.6 Flash62.77
4Claude Fable 562.5
5Claude Opus 558.51
6Qwen 3.7 Max53.19
7GLM-5.249.73
8Gemini 3.1 Pro (Preview)48.67
9GPT-5.6 Sol44.15
10Seed 2.1 Pro42.29
11GPT-5.541.76
12Claude Opus 4.837.23
13Kimi K2.633.78

Interactive version: theaggregate.ai/benchmark?slug=mobilepa-bench-memory-usage · How It Works · Data refreshed daily, snapshot 2026-09-19.