SEAL - MultiChallenge — leaderboard

Metric: Score. Source: scale.com. 30 models tracked.

Top models

#ModelScore
1Muse Spark75.52
2Muse Spark 1.175.3
3Gemini 3.1 Pro (Preview)71.37
4GPT-5.4 Pro (xHigh)69.23
5Gemini 3 Pro (Preview)65.67
6GPT-5.1 (Thinking)63.41
7GPT-5 (Thinking)63.19
8Kimi K2.561.39
9Gemini 3.1 Flash Lite (Preview)60.61
10Claude Opus 4.5 (20251101) (Thinking)58.97
11Claude Opus 4 (Thinking)58.62
12Claude Opus 4.1 (20250805) (Thinking)57.2
13Claude Sonnet 4 (Thinking)57.11
14O3 (2025-04-16) (High)56.62
15Claude Opus 4.6 (Non-reasoning)56.02

Interactive version: theaggregate.ai/benchmark?slug=seal-multichallenge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.