SWE-rebench — leaderboard

Continuously refreshed software-engineering benchmark built from real pull requests, designed to evaluate coding agents on decontaminated issue-resolution tasks.

Metric: Resolved (%). Source: swe-rebench.com. Status: saturation imminent. 91 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)62.73
2GLM-5.162.67
3Qwen 3.5 397B A17B59.94
4Step 3.5 Flash59.58
5GPT-5.2 (Medium)59.25
6Qwen 3.5 27B58.95
7GPT-5.5 (Medium)58.91
8GPT-5.3 Codex (xHigh)58.6
9GPT-5.3 Codex58.21
10GPT-5.4 (Medium)57.6
11GPT-5.2 (xHigh)56.57
12Claude Opus 4.8 (xHigh)56.55
13Gemini 3.1 Pro (Preview)54.91
14Claude Sonnet 4.654.49
15GPT-5.1 Codex Max54.48

Interactive version: theaggregate.ai/benchmark?slug=swe-rebench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.