SWT-Bench Verified: leaderboard

Metric: Success rate S (%, issues reproduced, unit test mode). Source: swtbench.com. Saturation forecast: Rough model projection: around 2026. 12 models tracked.

Top models

#ModelScore
1PatchTwin+Guard + GPT-582.9
2GPT-5 (OpenHands)79.8
3PatchTwin+Guard + GPT-5-mini75.8
4ReProAgent + GPT-5-mini69.7
5GPT-5-mini (OpenHands)62.4
6e-Otter++ + Claude 3.7 Sonnet62.1
7AssertFlip + GPT-4o45.5
8Otter++ + GPT-4o37.4
9Otter + GPT-4o31.6
10Claude 3.5 Sonnet (OpenHands, CI setup)27.7

Interactive version: theaggregate.ai/benchmark?slug=swt-bench-verified · How It Works · Data refreshed daily, snapshot 2026-09-26.