AppSim-Bench - Chinese Apps: leaderboard

Metric: Task-weighted Accuracy (%). Source: arxiv.org. 19 models tracked.

Top models

#ModelScore
1Claude Opus 4.760.07
2Gemini 3 Pro60.07
3Gemini 3.1 Pro (Preview)59.36
4GPT-5.558.66
5Seed-1.650.88
6Qwen 3.6 Plus39.58
7Qwen 3.6 Flash38.87
8GPT-537.81
9GPT-5.434.63
10Seed 1.834.63
11Claude Sonnet 4.631.1
12uitars-1.5-7B31.1
13Claude Sonnet 4.524.03
14Claude Haiku 4.522.61
15Gemini 2.5 Pro21.2

Interactive version: theaggregate.ai/benchmark?slug=appsim-bench-chinese-apps · How It Works · Data refreshed daily, snapshot 2026-09-20.