Ramp SWE-Bench: leaderboard

Ramp Labs benchmark for background coding agents on realistic financial software engineering work, scored by resolved tasks with the mini-SWE-agent harness.

Metric: Resolved (%). Source: labs.ramp.com. Status: saturation imminent. 26 models tracked.

Top models

#ModelScore
1Claude Fable 588.46
2Claude Opus 588.46
3Kimi K387.18
4GPT-5.583.33
5Claude Opus 4.783.33
6GPT-5.6 Sol83.33
7GLM-5.282.05
8Grok 4.582.05
9Claude Opus 4.680.77
10Kimi K2.7 Code80.77
11DeepSeek V4 Flash (0731)79.49
12Claude Opus 4.878.21
13GPT-5.6 Terra76.92
14Claude Sonnet 575.64
15Gemini 3.1 Pro (Preview)74.36

Interactive version: theaggregate.ai/benchmark?slug=ramp-swe-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.