SWE-bench — leaderboard

Real-world software engineering benchmark using actual GitHub issues from Django, Matplotlib, SymPy, and more. Multiple variants: Verified, Multimodal, Lite. The gold standard for AI coding evaluation.

Metric: Resolve rate (%). Source: huggingface.co. Status: saturation imminent. 24 models tracked.

Top models

#ModelScore
1Sonar Foundation Agent + Claude 4.5 Opus52.62
2Salesforce AI Research SAGE (bash-only)44.25
3Atlassian Rovo Dev (2025-06-05)41.98
4Amazon Q Developer Agent (v20250405-dev)37.1
5SWE-agent 1.0 (Claude 3.7 Sonnet)33.83
6Amazon Q Developer Agent (v20241202-dev)29.99
7OpenHands + CodeAct v2.1 (claude-3-5-sonnet-20241022)29.38
8AutoCodeRover-v2.0 (Claude-3.5-Sonnet-20241022)24.89
9Honeycomb22.06
10Amazon Q Developer Agent (v20240719-dev)19.75

Interactive version: theaggregate.ai/benchmark?slug=swe-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.