SWE-bench Live — leaderboard
Live SWE-bench-style benchmark with recent real GitHub software issues, reducing contamination while measuring repository-level repair ability.
Metric: Resolved (%). Source: swe-bench-live.github.io. 18 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | AMI Agent + Claude-4.6-Opus | 63 |
| 2 | SWE-agent + Claude-4.5-Sonnet | 40 |
| 3 | SWE-agent + GPT5-Thinking (Medium) | 30.4 |
| 4 | OpenHands + Qwen3-Coder-480B-A35B | 24.67 |
| 5 | MIT-IBM Agent (BOAD) + SWE-Agent + Seed-OSS-36B | 20 |
| 6 | SWE-agent + Claude 3.7 Sonnet | 17.67 |
| 7 | OpenHands + Claude 3.7 Sonnet | 17.67 |
| 8 | SWE-agent + GPT 4.1 | 16.33 |
| 9 | SWE-agent + DeepSeek V3 | 15.33 |
| 10 | Agentless + DeepSeek V3 | 13.33 |
Interactive version: theaggregate.ai/benchmark?slug=swe-bench-live · How the rankings work · Data refreshed daily, snapshot 2026-07-22.