Multi-SWE-Bench (c) — leaderboard

Metric: Score (%). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1RepoRepair + Claude-4-Sonnet12.61
2MSWE-agent + Gemini-2.5-Pro9.38
3MagentLess + Gemini-2.5-Pro9.38
4MSWE-agent + Claude-3.7-Sonnet8.59
5MopenHands + Claude-3.7-Sonnet8.59
6MagentLess + Claude-3.7-Sonnet6.25
7MopenHands + Gemini-2.5-Pro5.47
8MSWE-agent + Claude-3.5-Sonnet(Oct)4.69
9MagentLess + Doubao-1.5-thinking4.69
10MagentLess + Llama-4-Maverick3.91

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-c · How the rankings work · Data refreshed daily, snapshot 2026-07-22.