SWE-bench Verified: leaderboard

The 'Verified' subset of SWE-bench - 500 human-validated GitHub issues ensuring correct problem statements and test coverage. The most trusted variant for measuring real-world software engineering ability.

Metric: Resolved (%). Source: www.swebench.com. Status: saturation imminent. 47 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (High)76.8
2Gemini 3 Flash (High)75.8
3Claude Opus 4.675.6
4GPT-5.2 (High)72.8
5GPT-5.2 Codex72.8
6Claude Sonnet 4.5 (High)71.4
7Claude Sonnet 4.570.6
8Gemini 3 Pro69.6
9GPT-5.269
10Claude Opus 4 (20250514)67.6
11GPT-5 (Medium)65
12Claude Sonnet 4 (20250514)64.9
13Kimi K2 (Thinking)63.4
14MiniMax-M261
15O3 (2025-04-16)58.4

Interactive version: theaggregate.ai/benchmark?slug=swe-bench-verified · How It Works · Data refreshed daily, snapshot 2026-09-05.