SEAL Showdown — leaderboard

Scale AI human expert evaluation of LLMs across real-world tasks. Arena-style scoring based on pairwise comparisons by trained human raters.

Metric: Arena Score. Source: scale.com. Status: saturation imminent. 47 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)1255.9
2Gemini 3 Flash1216.3
3Claude Opus 4.7 (Thinking)1117.2
4GPT-5.51110.4
5Claude Opus 4.6 (Thinking)1109.7
6Claude Opus 4.1 (20250805) (Thinking)1099.6
7GPT-5.1 (Medium)1099.1
8Claude Opus 4.71087.7
9Claude Opus 4.61086.1
10Kimi K2.5 (Thinking)1076.8
11DeepSeek V3.21076.3
12GPT-5.5 (Medium)1075.4
13Claude Sonnet 4.61070.1
14GPT-5 Chat1069.4
15Claude Opus 4.5 (20251101)1068.8

Interactive version: theaggregate.ai/benchmark?slug=seal-showdown · How the rankings work · Data refreshed daily, snapshot 2026-07-22.