SEAL - MASK — leaderboard

Metric: Score. Source: scale.com. 67 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Non-reasoning)96.28
2Claude Sonnet 4.5 (Thinking)96.13
3Claude Sonnet 4 (Thinking)95.33
4Claude Opus 4.1 (20250805) (Thinking)94.2
5Claude Opus 4.5 (20251101) (Thinking)92.53
6GPT-OSS-120B92
7GPT-5.4 Pro (xHigh)91.73
8GPT-5.4 (xHigh)89.67
9Claude Sonnet 489.27
10Claude Opus 4 (Thinking)87.87
11Claude Opus 4.1 (20250805)87.4
12Claude Opus 4.5 (20251101)87.13
13GPT-5.286.67
14GPT-OSS-20B86.46
15Claude Sonnet 4.586.4

Interactive version: theaggregate.ai/benchmark?slug=seal-mask · How the rankings work · Data refreshed daily, snapshot 2026-07-22.