LLM Stats (DeepSWE 1.1): leaderboard

Metric: Score (%). Source: llm-stats.com. 31 models tracked.

Top models

#ModelScore
1Muse Spark 1.375.4
2GPT-674.1
3Gemini 3.8 Flash73.7
4GPT-5.6 Sol73
5Claude Fable 570
6GPT-5.6 Terra70
7Kimi K369
8Claude Opus 568.8
9GPT-5.567
10GPT-5.6 Luna67
11GLM-5.366.9
12Grok 4.665.9
13Gemini 3.7 Flash65.3
14GLM-5.3 Flash63.4
15Muse Spark 1.259.3

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-deepswe-1-1 · How It Works · Data refreshed daily, snapshot 2026-09-08.