SWT-Bench Lite: leaderboard
Metric: Success rate S (%, issues reproduced, unit test mode). Source: swtbench.com. Saturation forecast: Rough model projection: around 2026. 17 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | ReProAgent + GPT-5-mini | 56.2 |
| 2 | e-Otter++ + Claude 3.7 Sonnet | 52.5 |
| 3 | AssertFlip + GPT-4o | 38 |
| 4 | Claude 3.5 Sonnet (OpenHands, CI setup) | 28.3 |
| 5 | Claude 3.5 Sonnet (OpenHands, vanilla) | 22.8 |
| 6 | SWE-Agent+ + gpt-4-1106-preview | 18.5 |
| 7 | Mistral Large 2 (SWE-agent) | 16.3 |
| 8 | gpt-4-1106-preview (SWE-agent) | 15.9 |
| 9 | LIBRO + gpt-4-1106-preview | 14.1 |
| 10 | gpt-4-1106-preview (Aider) | 12.7 |
Interactive version: theaggregate.ai/benchmark?slug=swt-bench-lite · How It Works · Data refreshed daily, snapshot 2026-09-26.