SWE-bench — leaderboard
Real-world software engineering benchmark using actual GitHub issues from Django, Matplotlib, SymPy, and more. Multiple variants: Verified, Multimodal, Lite. The gold standard for AI coding evaluation.
Metric: Resolve rate (%). Source: huggingface.co. Status: saturation imminent. 24 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Sonar Foundation Agent + Claude 4.5 Opus | 52.62 |
| 2 | Salesforce AI Research SAGE (bash-only) | 44.25 |
| 3 | Atlassian Rovo Dev (2025-06-05) | 41.98 |
| 4 | Amazon Q Developer Agent (v20250405-dev) | 37.1 |
| 5 | SWE-agent 1.0 (Claude 3.7 Sonnet) | 33.83 |
| 6 | Amazon Q Developer Agent (v20241202-dev) | 29.99 |
| 7 | OpenHands + CodeAct v2.1 (claude-3-5-sonnet-20241022) | 29.38 |
| 8 | AutoCodeRover-v2.0 (Claude-3.5-Sonnet-20241022) | 24.89 |
| 9 | Honeycomb | 22.06 |
| 10 | Amazon Q Developer Agent (v20240719-dev) | 19.75 |
Interactive version: theaggregate.ai/benchmark?slug=swe-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.