SWE-bench Verified (SWE-ABS Tests): leaderboard

Metric: Resolve rate (%) on the 500 SWE-bench Verified tasks when each bash-only (mini-SWE-agent) leaderboard submission's patches are re-run against the SWE-ABS strengthened test suites (original tests plus coverage- and mutation-guided tests, overfitting tests fixed); higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 29 models tracked.

Top models

#ModelScoreOverall rank
1GPT-5.2 (2025-12-11) (High)56.8
2Claude Sonnet 4.554.4#138
3GPT-5.251.6#105
4Claude Opus 4 (20250514)50.6#148
5GPT-5 (Medium)48.6#91 (GPT-5)
6Claude Sonnet 4 (20250514)45.8#211
7Kimi K2 (Thinking)45#236 (Kimi K2)
8GPT-5 Mini (2025-08-07) (Medium)44.6#165 (GPT-5 Mini (2025-08-07))
9MiniMax-M244.4#307
10O3 (2025-04-16)43.8#117
11Gemini 2.5 Pro (Preview 05-06)40.8#143
12GLM-4.640.2#246
13GLM-4.538.2#265
14GPT-5 Nano (2025-08-07) (Medium)22.8
15GPT-OSS-120B20.2#330

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=swe-bench-verified-swe-abs-tests · How It Works · Data refreshed daily, snapshot 2026-10-11.