OpenEvals - SWE-bench Pro: leaderboard
Metric: Resolved (%). Source: huggingface.co. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen3-Coder-Next | 44.3 |
| 2 | Qwen3-Coder-480B-A35B-Instruct | 38.7 |
| 3 | MiniMax-M2.1 | 36.81 |
| 4 | Kimi-K2-Instruct | 27.67 |
| 5 | Qwen3-235B-A22B | 21.41 |
| 6 | gpt-oss-120b | 16.2 |
| 7 | DeepSeek-V3.2 | 15.56 |
| 8 | gemma-3-27b-it | 11.38 |
| 9 | Llama-3.1-405B-Instruct | 11.18 |
| 10 | GLM-4.6 | 9.67 |
Interactive version: theaggregate.ai/benchmark?slug=openevals-swe-bench-pro · How It Works · Data refreshed daily, snapshot 2026-09-05.