Vals AI SWE-bench Verified: leaderboard

Metric: Resolved (%). Source: www.vals.ai. 88 models tracked.

Top models

#ModelScore
1Claude Opus 597
2DeepSeek V4 Pro (0813) (Max)96.4
3GPT-5.6 Sol (Max)96.2
4Grok 4.6 (High)95.6
5GLM-5.3 (Max)95.4
6GPT-5.6 Terra (Max)95.4
7Claude Fable 5 (Max)95
8Kimi K393.4
9GPT-5.6 Luna (Max)93
10GLM-5.3 Flash (Max)92
11DeepSeek V4 Flash (0731) (High)88.8
12Claude Opus 4.8 (Max)88.6
13Muse Spark 1.2 (xHigh)86.6
14Grok 4.5 (High)86.6
15Qwen 3.8 27B (xHigh)86

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-swe-bench-verified · How It Works · Data refreshed daily, snapshot 2026-09-05.