Multi-SWE-Bench (javascript) — leaderboard
Metric: Score (%). Source: huggingface.co. 37 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | RepoRepair + Claude-4.5-Sonnet | 18.26 |
| 2 | MopenHands + Gemini-2.5-Pro | 16.29 |
| 3 | MopenHands + Doubao-1.5-thinking | 9.55 |
| 4 | MagentLess + Gemini-2.5-Pro | 8.71 |
| 5 | MSWE-agent + Gemini-2.5-Pro | 7.58 |
| 6 | MagentLess + Doubao-1.5-thinking | 5.62 |
| 7 | MopenHands + Claude-3.7-Sonnet | 5.06 |
| 8 | MagentLess + Llama-4-Maverick | 5.06 |
| 9 | MagentLess + OpenAI-o1 | 5.06 |
| 10 | MSWE-agent + Claude-3.7-Sonnet | 4.78 |
Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-javascript · How the rankings work · Data refreshed daily, snapshot 2026-07-22.