AppSim-Bench - English Apps: leaderboard

Metric: Task-weighted Accuracy (%). Source: arxiv.org. 19 models tracked.

Top models

#ModelScore
1GPT-5.540.51
2Claude Opus 4.740.15
3Gemini 3.1 Pro (Preview)39.42
4Gemini 3 Pro39.42
5Seed 1.829.56
6GPT-528.83
7Seed-1.627.01
8Claude Sonnet 4.623.36
9GPT-5.423.36
10Claude Haiku 4.522.99
11Qwen 3.6 Plus22.99
12Claude Sonnet 4.517.88
13Qwen 3.6 Flash17.15
14uitars-1.5-7B13.87
15Gemini 2.5 Pro13.14

Interactive version: theaggregate.ai/benchmark?slug=appsim-bench-english-apps · How It Works · Data refreshed daily, snapshot 2026-09-20.