SWEeper-Bench - Pass: leaderboard

Metric: Pass rate (%; 200 interactive software bug-discovery tasks; native agent harnesses; scoped prompt; unlimited time). Source: sweeperbench.com. Saturation forecast: Around September 2028. 15 models tracked.

Top models

#ModelScore
1Grok 4.6 (xHigh)59
2Claude Opus 5 (xHigh)56.5
3GPT-6 Astra (xHigh)56.5
4Claude Fable 5.1 (xHigh)56.5
5Kimi K3 (High)48.5
6GPT-5.6 Sol (xHigh)47
7GLM-5.3 (Max)43.5
8GPT-5.6 Luna (xHigh)42
9GLM-5.3 Flash (Max)39.5
10GPT-5.6 Terra (xHigh)35

Interactive version: theaggregate.ai/benchmark?slug=sweeper-bench-pass · How It Works · Data refreshed daily, snapshot 2026-10-09.