SWT-Bench Lite: leaderboard

Metric: Success rate S (%, issues reproduced, unit test mode). Source: swtbench.com. Saturation forecast: Rough model projection: around 2026. 17 models tracked.

Top models

#ModelScore
1ReProAgent + GPT-5-mini56.2
2e-Otter++ + Claude 3.7 Sonnet52.5
3AssertFlip + GPT-4o38
4Claude 3.5 Sonnet (OpenHands, CI setup)28.3
5Claude 3.5 Sonnet (OpenHands, vanilla)22.8
6SWE-Agent+ + gpt-4-1106-preview18.5
7Mistral Large 2 (SWE-agent)16.3
8gpt-4-1106-preview (SWE-agent)15.9
9LIBRO + gpt-4-1106-preview14.1
10gpt-4-1106-preview (Aider)12.7

Interactive version: theaggregate.ai/benchmark?slug=swt-bench-lite · How It Works · Data refreshed daily, snapshot 2026-09-26.