ScreenSpot-Pro: leaderboard

Professional GUI grounding benchmark requiring agents to identify precise screen locations in high-resolution development, creative, and scientific software.

Metric: Score (%). Source: llm-stats.com. Status: saturation imminent. 26 models tracked.

Top models

#ModelScore
1GPT-692.7
2Claude Opus 4.887.9
3GPT-5.286.3
4Qwen 3.8 Max84.5
5Muse Spark84.1
6Qwen 3.7 Plus79
7Muse Glimmer 30B75.4
8Gemini 3 Pro72.7
9Qwen 3.5 122B A10B70.4
10Qwen 3.5 27B70.3
11Gemini 3 Flash69.1
12Qwen 3.5 35B A3B68.6
13Qwen 3.6 Plus68.2
14Qwen 3 VL 235B A22B Instruct62
15Qwen 3 VL 235B A22B (Thinking)61.8

Interactive version: theaggregate.ai/benchmark?slug=screenspot-pro · How It Works · Data refreshed daily, snapshot 2026-09-05.