Multi-SWE-Bench (go) — leaderboard

Metric: Score (%). Source: huggingface.co. 36 models tracked.

Top models

#ModelScore
1MopenHands + Gemini-2.5-Pro12.62
2MSWE-agent + Gemini-2.5-Pro9.81
3MopenHands + Claude-3.7-Sonnet7.48
4MopenHands + Claude-3.5-Sonnet(Oct)6.79
5MagentLess + Gemini-2.5-Pro6.07
6MopenHands + Doubao-1.5-thinking6.07
7MSWE-agent + Claude-3.5-Sonnet(Oct)5.84
8MagentLess + Claude-3.7-Sonnet5.84
9MopenHands + Llama-4-Maverick5.61
10MSWE-agent + Claude-3.7-Sonnet5.37

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-go · How the rankings work · Data refreshed daily, snapshot 2026-07-22.