Multi-SWE-Bench (typescript) — leaderboard

Metric: Score (%). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1RepoRepair + Claude-3.5-Sonnet(Oct)27.23
2MopenHands + Gemini-2.5-Pro22.32
3MopenHands + Claude-3.5-Sonnet(Oct)11.61
4MagentLess + Gemini-2.5-Pro11.61
5MSWE-agent + Claude-3.7-Sonnet11.16
6MagentLess + Llama-4-Maverick9.38
7MSWE-agent + Gemini-2.5-Pro8.93
8MSWE-agent + Claude-3.5-Sonnet(Oct)8.04
9MopenHands + Llama-4-Maverick8.04
10MagentLess + Doubao-1.5-thinking7.59

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-typescript · How the rankings work · Data refreshed daily, snapshot 2026-07-22.