DeepSWE: leaderboard

DataCurve benchmark where frontier coding agents work through original, long-horizon software engineering tasks in realistic repositories.

Metric: Pass@1 (%). Source: deepswe.datacurve.ai. Status: years away from saturation. 31 models tracked.

Top models

#ModelScore
1GPT-6 (xHigh)74.1
2Gemini 3 Flash73.8
3Claude Opus 573.6
4GPT-673.2
5GPT-5.6 Sol72.7
6GPT-5.6 Sol (xHigh)70.7
7Claude Fable 569.9
8GLM-5.369
9Kimi K368.5
10Grok 4.667.5
11GPT-5.5 (xHigh)67
12GPT-5.564.4
13GLM-5.3 Flash63.4
14DeepSeek V4 Pro62.8
15Claude Opus 4.859

Interactive version: theaggregate.ai/benchmark?slug=deepswe · How It Works · Data refreshed daily, snapshot 2026-09-05.