SEAL - MultiChallenge — leaderboard
Metric: Score. Source: scale.com. 30 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Muse Spark | 75.52 |
| 2 | Muse Spark 1.1 | 75.3 |
| 3 | Gemini 3.1 Pro (Preview) | 71.37 |
| 4 | GPT-5.4 Pro (xHigh) | 69.23 |
| 5 | Gemini 3 Pro (Preview) | 65.67 |
| 6 | GPT-5.1 (Thinking) | 63.41 |
| 7 | GPT-5 (Thinking) | 63.19 |
| 8 | Kimi K2.5 | 61.39 |
| 9 | Gemini 3.1 Flash Lite (Preview) | 60.61 |
| 10 | Claude Opus 4.5 (20251101) (Thinking) | 58.97 |
| 11 | Claude Opus 4 (Thinking) | 58.62 |
| 12 | Claude Opus 4.1 (20250805) (Thinking) | 57.2 |
| 13 | Claude Sonnet 4 (Thinking) | 57.11 |
| 14 | O3 (2025-04-16) (High) | 56.62 |
| 15 | Claude Opus 4.6 (Non-reasoning) | 56.02 |
Interactive version: theaggregate.ai/benchmark?slug=seal-multichallenge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.