OpenEvals - SWE-bench Pro — leaderboard

Metric: Resolved (%). Source: huggingface.co. 11 models tracked.

Top models

#ModelScore
1Qwen3 Coder Next44.3
2Qwen 3 Coder 480B A35B Instruct38.7
3MiniMax-M2.136.81
4Kimi K227.67
5Qwen 3 235B A22B21.41
6GPT-OSS-120B16.2
7DeepSeek V3.215.56
8Gemma 3 27B (IT)11.38
9Llama 3.1 405B Instruct11.18
10GLM-4.69.67
11Llama 4 Maverick Instruct5.24

Interactive version: theaggregate.ai/benchmark?slug=openevals-swe-bench-pro · How the rankings work · Data refreshed daily, snapshot 2026-07-22.