Multi-SWE-Bench (c++) — leaderboard

Metric: Score (%). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1InfCode + GPT5(Sep)25.58
2MopenHands + Claude-3.7-Sonnet14.73
3MopenHands + Claude-3.5-Sonnet(Oct)12.4
4MSWE-agent + Claude-3.7-Sonnet11.63
5MopenHands + Gemini-2.5-Pro9.3
6MSWE-agent + Gemini-2.5-Pro8.53
7MSWE-agent + DeepSeek-V37.75
8MopenHands + DeepSeek-V37.75
9MSWE-agent + Claude-3.5-Sonnet(Oct)6.98
10MSWE-agent + Llama-4-Maverick6.98

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-c-plus-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.