Multi-SWE-Bench (c++): leaderboard

Metric: Score (%). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1CodeArts Agent + CodeArts-GLM-5.147.29
2InfCode + GPT5(Sep)25.58
3MopenHands + Claude-3.7-Sonnet14.73
4MopenHands + Claude-3.5-Sonnet(Oct)12.4
5MSWE-agent + Claude-3.7-Sonnet11.63
6MopenHands + Gemini-2.5-Pro9.3
7MSWE-agent + Gemini-2.5-Pro8.53
8MSWE-agent + DeepSeek-V37.75
9MopenHands + DeepSeek-V37.75
10MSWE-agent + Claude-3.5-Sonnet(Oct)6.98

Interactive version: theaggregate.ai/benchmark?slug=multi-swe-bench-c-plus-plus · How It Works · Data refreshed daily, snapshot 2026-09-05.