OpenEvals - SWE-bench Pro — leaderboard
Metric: Resolved (%). Source: huggingface.co. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen3 Coder Next | 44.3 |
| 2 | Qwen 3 Coder 480B A35B Instruct | 38.7 |
| 3 | MiniMax-M2.1 | 36.81 |
| 4 | Kimi K2 | 27.67 |
| 5 | Qwen 3 235B A22B | 21.41 |
| 6 | GPT-OSS-120B | 16.2 |
| 7 | DeepSeek V3.2 | 15.56 |
| 8 | Gemma 3 27B (IT) | 11.38 |
| 9 | Llama 3.1 405B Instruct | 11.18 |
| 10 | GLM-4.6 | 9.67 |
| 11 | Llama 4 Maverick Instruct | 5.24 |
Interactive version: theaggregate.ai/benchmark?slug=openevals-swe-bench-pro · How the rankings work · Data refreshed daily, snapshot 2026-07-22.