Scale AI - VISTA: leaderboard

Vision-language understanding benchmark for multimodal models. Part of Scale's SEAL evaluation platform.

Metric: Score. Source: scale.com. Status: saturation imminent. 63 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)54.65
2Gemini 2.5 Pro (Preview 06-05)54.63
3GPT-5.4 Pro (xHigh)53.89
4GPT-5 Pro52.39
5O4 Mini (High)51.79
6O4 Mini (Medium)51.66
7O3 Pro (High)51.63
8Gemini 3 Pro (Preview)51.49
9GPT-5.4 (xHigh)50.89
10Gemini 2.5 Pro (Preview 05-06)50.78
11GPT-5 Mini50.39
12O3 (High)50.07
13GPT-549.69
14O3 (Medium)49.59
15Gemini 2.5 Flash (Preview 05-20)49.15

Interactive version: theaggregate.ai/benchmark?slug=scale-ai-vista · How It Works · Data refreshed daily, snapshot 2026-09-05.