Visual-Language Understanding: leaderboard

Scale's SEAL Leaderboard evaluates top models' visual-language understanding, testing perception, logic, calculation, and common sense.

Metric: Score. Source: scale.com. Status: saturation imminent. 63 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)54.65
2Gemini 2.5 Pro (Preview 06-05)54.63
3GPT-5.4 Pro (xHigh)53.89
4GPT-5 Pro52.39
5O4 Mini (High)51.79
6O4 Mini (Medium)51.66
7O3 Pro (High)51.63
8Gemini 3 Pro (Preview)51.49
9GPT-5.4 (xHigh)50.89
10Gemini 2.5 Pro (Preview 05-06)50.78
11GPT-5 Mini50.39
12O3 (High)50.07
13GPT-549.69
14O3 (Medium)49.59
15Gemini 2.5 Flash (Preview 05-20)49.15

Interactive version: theaggregate.ai/benchmark?slug=visual-language-understanding · How It Works · Data refreshed daily, snapshot 2026-09-05.