SEAL - SWE-Bench Pro (Public Dataset) — leaderboard

Metric: Score. Source: scale.com. 25 models tracked.

Top models

#ModelScore
1Muse Spark 1.161.5
2GPT-5.4 (xHigh)59.1
3Muse Spark55
4Claude Opus 4.6 (Thinking)51.9
5Gemini 3.1 Pro (Preview) (Thinking)46.1
6Claude Opus 4.5 (20251101)45.89
7Claude Sonnet 4.543.6
8Gemini 3 Pro (Preview)43.3
9Claude Sonnet 442.7
10GPT-5 (High)41.78
11GPT-5.2 Codex41.04
12Claude Haiku 4.539.45
13MiniMax-M2.136.81
14Gemini 3 Flash34.63
15GPT-5.229.94

Interactive version: theaggregate.ai/benchmark?slug=seal-swe-bench-pro-public-dataset · How the rankings work · Data refreshed daily, snapshot 2026-07-22.