SWT-Bench Verified: leaderboard
Metric: Success rate S (%, issues reproduced, unit test mode). Source: swtbench.com. Saturation forecast: Rough model projection: around 2026. 12 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | PatchTwin+Guard + GPT-5 | 82.9 |
| 2 | GPT-5 (OpenHands) | 79.8 |
| 3 | PatchTwin+Guard + GPT-5-mini | 75.8 |
| 4 | ReProAgent + GPT-5-mini | 69.7 |
| 5 | GPT-5-mini (OpenHands) | 62.4 |
| 6 | e-Otter++ + Claude 3.7 Sonnet | 62.1 |
| 7 | AssertFlip + GPT-4o | 45.5 |
| 8 | Otter++ + GPT-4o | 37.4 |
| 9 | Otter + GPT-4o | 31.6 |
| 10 | Claude 3.5 Sonnet (OpenHands, CI setup) | 27.7 |
Interactive version: theaggregate.ai/benchmark?slug=swt-bench-verified · How It Works · Data refreshed daily, snapshot 2026-09-26.