SWE-rebench: leaderboard

Continuously refreshed software-engineering benchmark built from real pull requests, evaluating coding agents on decontaminated issue-resolution tasks.

Metric: Resolved (%). Source: swe-rebench.com. Status: years away from saturation. 97 models tracked.

Top models

#ModelScore
1Claude Fable 5 (High)64.5
2Grok 4.5 (High)63.78
3Claude Opus 5 (High)63.42
4GPT-5.5 (xHigh)62.73
5GLM-5.162.67
6GPT-5.6 Sol (Medium)62.34
7Qwen 3.5 397B A17B59.94
8Step 3.5 Flash59.58
9GPT-5.2 (Medium)59.25
10Qwen 3.5 27B58.95
11GPT-5.5 (Medium)58.91
12GPT-5.3 Codex (xHigh)58.6
13GPT-5.3 Codex58.21
14GPT-5.4 (Medium)57.6
15GLM-5.2 (High)57.01

Interactive version: theaggregate.ai/benchmark?slug=swe-rebench · How It Works · Data refreshed daily, snapshot 2026-09-05.