Multi-SWE-Bench (rust) — leaderboard

Metric: Score (%). Source: huggingface.co. 36 models tracked.

Top models

#ModelScore
1MopenHands + Claude-3.7-Sonnet16.1
2MopenHands + Gemini-2.5-Pro14.64
3MopenHands + Claude-3.5-Sonnet(Oct)12.13
4MSWE-agent + Gemini-2.5-Pro10.04
5MagentLess + OpenAI-o3-mini-high7.95
6MagentLess + OpenAI-o17.11
7MagentLess + Doubao-1.5-thinking7.11
8MSWE-agent + Claude-3.5-Sonnet(Oct)6.69
9MSWE-agent + Claude-3.7-Sonnet6.69
10MagentLess + DeepSeek-R16.69

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-rust · How the rankings work · Data refreshed daily, snapshot 2026-07-22.