MobilePA-Bench - Overall: leaderboard

Metric: Weighted success (%; 50/10/20/20). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1Claude Opus 575.52
2Claude Fable 575.31
3Kimi K373.01
4Qwen 3.8 Max72.51
5Gemini 3.6 Flash71.21
6Gemini 3.1 Pro (Preview)71.18
7GLM-5.267.71
8Claude Opus 4.865.52
9Qwen 3.7 Max64.71
10Seed 2.1 Pro63.65
11GPT-5.6 Sol62.68
12GPT-5.561.44
13Kimi K2.655.63

Interactive version: theaggregate.ai/benchmark?slug=mobilepa-bench-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.