CursorBench 3.1: leaderboard

Cursor coding-agent benchmark for ambiguous, multi-file real-world tasks, including codebase understanding, bug finding, planning, and code review.

Metric: Score (%). Source: cursor.com. Status: saturation imminent. 49 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (Max)73.4
2Claude Fable 5.1 (xHigh)72.8
3Grok 4.6 (xHigh)70.8
4Claude Fable 5 (Max)70.5
5Claude Opus 5 (Max)70
6Grok 4.6 (High)69.9
7Claude Fable 5.1 (High)69.4
8Claude Opus 5 (xHigh)69.3
9Gemini 3.8 Flash (High)69.2
10GPT-5.6 Sol (Max)67.2
11Grok 4.6 (Medium)67.1
12Gemini 3.8 Flash (Medium)67
13Claude Opus 5 (High)66.7
14Claude Fable 5 (High)66.5
15Claude Fable 5 (Medium)65.2

Interactive version: theaggregate.ai/benchmark?slug=cursorbench-3-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.