SEAL - MultiNRC — leaderboard

Metric: Score. Source: scale.com. 44 models tracked.

Top models

#ModelScore
1Muse Spark 1.165.59
2GPT-5 Pro65.2
3Gemini 3.1 Pro (Preview)64.74
4GPT-5.4 Pro (xHigh)62.27
5Muse Spark59.05
6Gemini 3 Pro (Preview)58.96
7GPT-5.4 (xHigh)58.29
8Claude Opus 4.6 (Adaptive Reasoning, Max Effort)57.06
9GPT-552.13
10GPT-5.1 (Thinking)49
11Claude Opus 4.5 (20251101) (Thinking)48.63
12Claude Opus 4.6 (Non-reasoning)48.34
13O3 (2025-04-16) (High)45.5
14Gemini 2.5 Pro (Preview 06-05)45.12
15O3 (2025-04-16) (Medium)44.45

Interactive version: theaggregate.ai/benchmark?slug=seal-multinrc · How the rankings work · Data refreshed daily, snapshot 2026-07-22.