CursorBench 3.1 — leaderboard

Cursor coding-agent benchmark for ambiguous, multi-file real-world tasks, including codebase understanding, bug finding, planning, and code review.

Metric: Score (%). Source: cursor.com. Status: saturation imminent. 38 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)70.5
2GPT-5.6 Sol (Max)67.2
3Grok 4.5 (High)66.7
4Claude Fable 5 (High)66.5
5GPT-5.6 Terra (Max)64.9
6GPT-5.6 Sol (xHigh)64.5
7GPT-5.6 Sol (High)63.5
8Claude Opus 4.862.3
9Claude Sonnet 5 (Max)61.5
10GPT-5.6 Luna (Max)61.1
11GPT-5.6 Sol (Medium)60
12GPT-5.6 Terra (xHigh)59.2
13Claude Sonnet 5 (xHigh)58.7
14GPT-5.558.4
15GPT-5.6 Luna (xHigh)57.7

Interactive version: theaggregate.ai/benchmark?slug=cursorbench-3-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.