AppSim-Bench: leaderboard

Metric: Task-weighted Accuracy (%). Source: arxiv.org. 19 models tracked.

Top models

#ModelScore
1Claude Opus 4.750.27
2Gemini 3 Pro49.91
3GPT-5.549.73
4Gemini 3.1 Pro (Preview)49.55
5Seed-1.639.14
6GPT-533.39
7Seed 1.832.14
8Qwen 3.6 Plus31.42
9GPT-5.429.08
10Qwen 3.6 Flash28.19
11Claude Sonnet 4.627.29
12Claude Haiku 4.522.8
13uitars-1.5-7B22.62
14Claude Sonnet 4.521.01
15Gemini 2.5 Pro17.24

Interactive version: theaggregate.ai/benchmark?slug=appsim-bench · How It Works · Data refreshed daily, snapshot 2026-09-20.