SWE-bench Live: leaderboard
Live SWE-bench-style benchmark with recent real GitHub software issues, reducing contamination while measuring repository-level repair ability.
Metric: Resolved (%). Source: swe-bench-live.github.io. 20 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | AMI Agent + Claude-4.6-Opus | 63 |
| 2 | Slingshot-v3.3.0 + GPT-5.6-Sol | 44.67 |
| 3 | SWE-agent + Claude-4.5-Sonnet | 40 |
| 4 | SWE-agent + GPT5-Thinking (Medium) | 30.4 |
| 5 | Slingshot-v3.1.0 + Claude-4.6-Opus | 25 |
| 6 | OpenHands + Qwen3-Coder-480B-A35B | 24.67 |
| 7 | MIT-IBM Agent (BOAD) + SWE-Agent + Seed-OSS-36B | 20 |
| 8 | SWE-agent + Claude 3.7 Sonnet | 17.67 |
| 9 | OpenHands + Claude 3.7 Sonnet | 17.67 |
| 10 | SWE-agent + GPT 4.1 | 16.33 |
Interactive version: theaggregate.ai/benchmark?slug=swe-bench-live · How It Works · Data refreshed daily, snapshot 2026-09-05.