SlopCodeBench (Just Solve): leaderboard

Metric: Strict solve rate (%): share of the 196 checkpoints whose workspace passes every test, including all earlier checkpoints' regression tests (missing checkpoints count as unsolved), on SlopCodeBench's 36 iterative problems (196 checkpoints): the agent extends its own prior code as the CLI or API specification evolves, with hidden tests, run in the model's native coding harness (the harness and reasoning level are in the label), using the plain task prompt; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 19 models tracked.

Top models

#ModelScoreOverall rank
1GPT-5.5 (High)14.8#26 (GPT-5.5)
2GPT-5.3 Codex (High)11.2#68 (GPT-5.3 Codex)
3GPT-5.4 (High)10.7#76 (GPT-5.4)
4Claude Opus 4.6 (High)9.7#60 (Claude Opus 4.6)
5GPT-5.2 Codex (High)9.7#89 (GPT-5.2 Codex)
6Claude Opus 4.5 (High)9.2#79 (Claude Opus 4.5)
7Claude Opus 4.7 (High)8.2#45 (Claude Opus 4.7)
8Claude Sonnet 4.6 (High)7.1#85 (Claude Sonnet 4.6)
9GPT-5.4 Mini (High)5.1#202 (GPT-5.4 Mini)
10Kimi K2.54.6#139
11Kimi K2.5 (High)3.6#139 (Kimi K2.5)
12MiniMax-M2.71.5#248

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=slopcodebench-just-solve · How It Works · Data refreshed daily, snapshot 2026-10-11.