SWEeper-Bench - Target: leaderboard

Metric: Target rate (%; 200 interactive software bug-discovery tasks; native agent harnesses; scoped prompt; unlimited time). Source: sweeperbench.com. Saturation forecast: Around September 2028. 15 models tracked.

Top models

#ModelScore
1Grok 4.6 (xHigh)59
2Claude Opus 5 (xHigh)57.5
3GPT-6 Astra (xHigh)56.5
4Claude Fable 5.1 (xHigh)56.5
5Kimi K3 (High)49
6GPT-5.6 Sol (xHigh)47
7GLM-5.3 (Max)43.5
8GPT-5.6 Luna (xHigh)43.5
9GLM-5.3 Flash (Max)39.5
10GPT-5.6 Terra (xHigh)35.5

Interactive version: theaggregate.ai/benchmark?slug=sweeper-bench-target · How It Works · Data refreshed daily, snapshot 2026-10-09.