SWE-bench Live: leaderboard

Live SWE-bench-style benchmark with recent real GitHub software issues, reducing contamination while measuring repository-level repair ability.

Metric: Resolved (%). Source: swe-bench-live.github.io. 20 models tracked.

Top models

#ModelScore
1AMI Agent + Claude-4.6-Opus63
2Slingshot-v3.3.0 + GPT-5.6-Sol44.67
3SWE-agent + Claude-4.5-Sonnet40
4SWE-agent + GPT5-Thinking (Medium)30.4
5Slingshot-v3.1.0 + Claude-4.6-Opus25
6OpenHands + Qwen3-Coder-480B-A35B24.67
7MIT-IBM Agent (BOAD) + SWE-Agent + Seed-OSS-36B20
8SWE-agent + Claude 3.7 Sonnet17.67
9OpenHands + Claude 3.7 Sonnet17.67
10SWE-agent + GPT 4.116.33

Interactive version: theaggregate.ai/benchmark?slug=swe-bench-live · How It Works · Data refreshed daily, snapshot 2026-09-05.