SWE-Serve: leaderboard

Metric: pass@1 (%; mean over three runs of the fraction of the 53 tasks whose agent patch passes every hidden functional, regression, E2E and performance test; mini-SWE-agent harness, closed-book). Source: arxiv.org. Saturation forecast: Around June 2027. 31 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)75.5
2Claude Opus 5 (Max)75.5
3Claude Opus 5 (High)73.6
4Claude Opus 5 (xHigh)72.3
5Claude Opus 5 (Medium)68.6
6GPT-5.6 Sol (xHigh)66
7Kimi K3 (Max)64.2
8GPT-5.6 Luna (Max)64.2
9GPT-5.6 Terra (Max)64.2
10Claude Sonnet 5 (xHigh)64.2
11Claude Sonnet 5 (Max)61
12Claude Opus 5 (Low)60.4
13Claude Sonnet 5 (High)57.9
14GPT-5.6 Sol (High)56
15GPT-5.6 Luna (xHigh)55.3

Interactive version: theaggregate.ai/benchmark?slug=swe-serve · How It Works · Data refreshed daily, snapshot 2026-09-26.