Visual-Language Understanding — leaderboard

Scale's SEAL Leaderboard evaluates top models' visual-language understanding, testing perception, logic, calculation, and common sense.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturated. 54 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (03-25)54.65
2Gemini 2.5 Pro (Preview 06-05)54.63
3GPT-5.4 Pro (xHigh)53.89
4GPT-5 Pro52.39
5O4 Mini (High)51.79
6O3 Pro (High)51.63
7GPT-5.4 (xHigh)50.89
8GPT-5 Mini50.39
9O3 (High)50.07
10GPT-549.69
11Gemini 2.5 Flash (Preview 09-2025)49.15
12Claude Sonnet 4.548.75
13Claude Opus 4.148.44
14Claude 3.7 Sonnet (Thinking)48.23
15O1 Pro47.32

Interactive version: theaggregate.ai/benchmark?slug=visual-language-understanding · How the rankings work · Data refreshed daily, snapshot 2026-07-22.