Android Bench: leaderboard

Google's benchmark for LLM performance on Android development tasks. 100 test cases based on Google's prescribed Android best practices, scored by percentage successfully resolved across 10 runs.

Metric: Score (%). Source: developer.android.com. Status: saturation imminent. 32 models tracked.

Top models

#ModelScore
1Claude Opus 591.8
2Claude Fable 590.9
3GPT-5.6 Sol90.8
4Kimi K390.2
5GPT-5.6 Luna87.6
6Qwen 3.8 Max87
7GPT-5.6 Terra86.8
8GPT-5.580.2
9Claude Sonnet 576.2
10Gemini 3.6 Flash75.6
11Gemini 3.1 Pro (Preview)74.3
12GPT-5.474.1
13Claude Opus 4.872.4
14GLM-5.272.2
15Gemini 3.5 Flash71.1

Interactive version: theaggregate.ai/benchmark?slug=android-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.