Android Bench — leaderboard

Google's benchmark for LLM performance on Android development tasks. 100 test cases based on Google's prescribed Android best practices, scored by percentage successfully resolved across 10 runs.

Metric: Score (%). Source: developer.android.com. Status: saturation imminent. 25 models tracked.

Top models

#ModelScore
1Claude Fable 584.5
2GPT-5.580.2
3Claude Sonnet 576.2
4GPT-5.474.1
5Gemini 3.1 Pro (Preview)73.7
6Claude Opus 4.872.4
7GLM-5.272.2
8Gemini 3.5 Flash71.1
9Kimi K2.7 Code70.4
10Claude Opus 4.768.7
11Kimi K2.667.6
12Claude Sonnet 4.667
13MiniMax-M363.6
14GLM-5.163.2
15Gemini 3 Flash (Preview)62.5

Interactive version: theaggregate.ai/benchmark?slug=android-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.