Multi-SWE-Bench (c): leaderboard

Metric: Score (%). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1CodeArts Agent + CodeArts-GLM-5.154.33
2RepoRepair + Claude-4-Sonnet12.61
3MagentLess + Gemini-2.5-Pro9.38
4MSWE-agent + Gemini-2.5-Pro9.38
5MopenHands + Claude-3.7-Sonnet8.59
6MSWE-agent + Claude-3.7-Sonnet8.59
7MagentLess + Claude-3.7-Sonnet6.25
8MopenHands + Gemini-2.5-Pro5.47
9MSWE-agent + Claude-3.5-Sonnet(Oct)4.69
10MagentLess + Doubao-1.5-thinking4.69

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-c · How It Works · Data refreshed daily, snapshot 2026-09-05.