SWE-bench Live — leaderboard

Live SWE-bench-style benchmark with recent real GitHub software issues, reducing contamination while measuring repository-level repair ability.

Metric: Resolved (%). Source: swe-bench-live.github.io. 18 models tracked.

Top models

#ModelScore
1AMI Agent + Claude-4.6-Opus63
2SWE-agent + Claude-4.5-Sonnet40
3SWE-agent + GPT5-Thinking (Medium)30.4
4OpenHands + Qwen3-Coder-480B-A35B24.67
5MIT-IBM Agent (BOAD) + SWE-Agent + Seed-OSS-36B20
6SWE-agent + Claude 3.7 Sonnet17.67
7OpenHands + Claude 3.7 Sonnet17.67
8SWE-agent + GPT 4.116.33
9SWE-agent + DeepSeek V315.33
10Agentless + DeepSeek V313.33

Interactive version: theaggregate.ai/benchmark?slug=swe-bench-live · How the rankings work · Data refreshed daily, snapshot 2026-07-22.