Horangi 4 - SWE-bench Verified (80-task subset): leaderboard

Metric: Resolved (%). Source: horangi.ai. 105 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)73.75
2GPT-5.4 (xHigh)73.75
3GPT-5.5 (xHigh)70
4Gemini 3 Pro (Preview) (High)68.75
5GPT-5.4 Mini (xHigh)67.5
6Gemini 3.1 Pro (Preview) (High)67.5
7Claude Fable 5 (High)66.25
8Qwen 3.7 Plus66.22
9Grok 4.2065.38
10GPT-5.6 Sol (Max)65
11Gemini 3.5 Flash64.56
12Qwen 3.7 Max64.47
13Claude Opus 4.5 (20251101) (High)62.82
14Grok 4.559.49
15Claude Opus 4.6 (High)58.97

Interactive version: theaggregate.ai/benchmark?slug=horangi-4-swe-bench-verified-80-task-subset · How It Works · Data refreshed daily, snapshot 2026-09-19.