SEAL - SWE-Bench Pro (Private Dataset) — leaderboard

Metric: Score. Source: scale.com. 14 models tracked.

Top models

#ModelScore
1Muse Spark 1.151.5
2Claude Opus 4.6 (Thinking)47.1
3Muse Spark44.7
4GPT-5.4 (xHigh)43.4
5Gemini 3.1 Pro (Preview) (Thinking)32.2
6GPT-5.2 Codex27.74
7GPT-5.223.81
8Claude Opus 4.523.44
9Gemini 3 Pro17.95
10Claude Opus 4.117.75
11GPT-514.86
12Claude Sonnet 49.06
13GPT-4o3.62

Interactive version: theaggregate.ai/benchmark?slug=seal-swe-bench-pro-private-dataset · How the rankings work · Data refreshed daily, snapshot 2026-07-22.