SEAL Showdown: leaderboard

Scale AI human expert evaluation of LLMs across real-world tasks. Arena-style scoring based on pairwise comparisons by trained human raters.

Metric: Arena Score. Source: scale.com. Status: saturation imminent. 47 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)1255.4
2Gemini 3 Flash1206.5
3GPT-5.51116.4
4Claude Opus 4.7 (Thinking)1113.1
5Claude Opus 4.6 (Thinking)1109
6Claude Opus 4.1 (20250805) (Thinking)1093
7GPT-5.1 (Medium)1092.9
8Claude Opus 4.71087.1
9Claude Opus 4.61086.1
10Kimi K2.5 (Thinking)1085.1
11GPT-5 Chat1081.5
12DeepSeek V3.21077.7
13GPT-5.5 (Medium)1077.6
14Claude Sonnet 4.61072.4
15Claude Opus 4.5 (20251101)1066

Interactive version: theaggregate.ai/benchmark?slug=seal-showdown · How It Works · Data refreshed daily, snapshot 2026-09-05.