SWE-bench Verified — leaderboard

The 'Verified' subset of SWE-bench - 500 human-validated GitHub issues ensuring correct problem statements and test coverage. The most trusted variant for measuring real-world software engineering ability.

Metric: Resolved (%). Source: www.swebench.com. Status: saturation imminent. 47 models tracked.

Top models

#ModelScore
1Claude Opus 4.675.6
2GPT-5 (High)72.8
3GPT-5 Codex72.8
4GPT-5.2 (High)71.8
5Kimi K2.570.8
6Claude Sonnet 4.570.6
7Gemini 3 Pro69.6
8GPT-5.269
9Claude Opus 4 (20250514)67.6
10GPT-5.1 (Medium)66
11GPT-5 (Medium)65
12Claude Sonnet 4 (20250514)64.9
13Kimi K2 (Thinking)63.4
14MiniMax-M261
15GPT-5 Mini (Medium)59.8

Interactive version: theaggregate.ai/benchmark?slug=swe-bench-verified · How the rankings work · Data refreshed daily, snapshot 2026-07-22.