Vals AI SWE-bench Verified — leaderboard

Metric: Resolved (%). Source: www.vals.ai. 72 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol96.2
2Claude Fable 595
3Kimi K393.4
4GPT-5.6 Luna93
5Claude Opus 4.888.6
6Grok 4.586.6
7GLM-5.282.8
8GPT-5.582.6
9Claude Opus 4.782
10Muse Spark 1.182
11Claude Sonnet 579.6
12Gemini 3.1 Pro (Preview)78.8
13Gemini 3.5 Flash78.8
14Claude Opus 4.6 (Thinking)78.2
15Kimi K2.7 Code78.2

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-swe-bench-verified · How the rankings work · Data refreshed daily, snapshot 2026-07-22.