MobilePA-Bench - Basic Tool Use: leaderboard

Metric: Aggregate accuracy (%). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1Claude Opus 583.85
2Claude Fable 583.37
3Gemini 3.1 Pro (Preview)80.58
4Claude Opus 4.879.04
5Gemini 3.6 Flash78.65
6Qwen 3.8 Max77.88
7Kimi K377.4
8Qwen 3.7 Max76.54
9GLM-5.276.06
10Seed 2.1 Pro72.98
11Kimi K2.670.38
12GPT-5.6 Sol69.81
13GPT-5.568.94

Interactive version: theaggregate.ai/benchmark?slug=mobilepa-bench-basic-tool-use · How It Works · Data refreshed daily, snapshot 2026-09-19.