MobilePA-Bench - Skill Usage: leaderboard

Metric: Joint success (%; SOR and MTSR). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1Claude Opus 578
2Kimi K376.5
3Qwen 3.8 Max76.25
4Claude Fable 570.25
5GPT-5.6 Sol70
6GLM-5.267.75
7Claude Opus 4.867.5
8GPT-5.567.25
9Gemini 3.1 Pro (Preview)67
10Seed 2.1 Pro63.75
11Gemini 3.6 Flash63.5
12Qwen 3.7 Max53.75
13Kimi K2.646.5

Interactive version: theaggregate.ai/benchmark?slug=mobilepa-bench-skill-usage · How It Works · Data refreshed daily, snapshot 2026-09-19.