GosuEvals — leaderboard

Ranks LLMs by real-world performance inside coding agents - Cursor, Cline, and Windsurf. Models scoring above 65% are considered viable for routine development work. Filterable by agent and model.

Metric: Score (%). Source: gosuevals.com. 29 models tracked.

Top models

#ModelScore
1Claude Sonnet 4 (Thinking)74.3
2Claude Sonnet 473.8
3Claude 3.7 Sonnet73.2
4Claude Opus 471.8
5Claude 3.5 Sonnet71.2
6Claude 3.7 Sonnet (Thinking)71
7GPT-4.169.8
8Gemini 2.5 Pro (Preview 03-25)63.1
9Gemini 2.5 Flash (Preview 05-20)56.2
10Gemini 2.5 Pro (Preview 05-06)52
11Gemini 2.0 Flash49
12Grok 3 Mini (High)47.5
13O4 Mini39.5
14DeepSeek R114.2

Interactive version: theaggregate.ai/benchmark?slug=gosuevals · How the rankings work · Data refreshed daily, snapshot 2026-07-22.