DeepSWE-mini (16 Tasks): leaderboard

Metric: Pass@1 (%, 16-task subset). Source: huggingface.co. 31 models tracked.

Top models

#ModelScore
1GPT-6 (xHigh)81.25
2GPT-679.69
3GPT-5.6 Sol78.12
4Claude Opus 575
5Gemini 3 Flash75
6Kimi K370.31
7GPT-5.5 (xHigh)70.31
8GLM-5.370.31
9Grok 4.670.31
10GPT-5.6 Sol (xHigh)70.31
11Claude Fable 567.71
12GLM-5.3 Flash66.15
13GPT-5.565.62
14DeepSeek V4 Pro59.38
15Claude Opus 4.855

Interactive version: theaggregate.ai/benchmark?slug=deepswe-mini-16-tasks · How It Works · Data refreshed daily, snapshot 2026-09-20.