OpenEvals - SWE-bench Verified — leaderboard

Metric: Resolved (%). Source: huggingface.co. 15 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B76.4
2MiniMax-M2.575.8
3Step 3.5 Flash74.4
4GLM-572.8
5Qwen 3.5 27B72.4
6Qwen 3.5 122B A10B72
7Kimi K2.570.8
8Qwen3 Coder Next70.6
9DeepSeek V3.270
10Qwen 3.5 35B A3B69.2
11NVIDIA-Nemotron-3-Super-120B-A12B-BF1653.73
12GPT-OSS-120B47.9
13GPT-OSS-20B37.4

Interactive version: theaggregate.ai/benchmark?slug=openevals-swe-bench-verified · How the rankings work · Data refreshed daily, snapshot 2026-07-22.