Ramp SWE-Bench — leaderboard

Ramp Labs benchmark for background coding agents on realistic financial software engineering work, scored by resolved tasks with the mini-SWE-agent harness.

Metric: Resolved (%). Source: labs.ramp.com. Status: saturated. 24 models tracked.

Top models

#ModelScore
1Claude Fable 587.34
2GPT-5.583.54
3Claude Opus 4.783.54
4GPT-5.6 Sol82.28
5GLM-5.281.01
6Grok 4.581.01
7Claude Opus 4.679.75
8Kimi K2.7 Code79.75
9Claude Opus 4.878.48
10GPT-5.6 Terra75.95
11Gemini 3.1 Pro (Preview)74.68
12Claude Sonnet 574.68
13GPT-5.473.42
14Kimi K2.673.42
15GPT-5.6 Luna73.42

Interactive version: theaggregate.ai/benchmark?slug=ramp-swe-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.