Aider Refactoring Benchmark: leaderboard

Aider benchmark for model performance on code refactoring tasks.

Metric: Percent completed correctly (self-reported). Source: benchmarklist.com. Status: saturated. 14 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)92.1
2O1 Preview75.3
3Claude 3 Opus (20240229)72.3
4Claude 3.5 Sonnet (20240620)64
5GPT-4o62.9
6GPT-4 Preview (1106)50.6
7Gemini 1.5 Pro49.4
8GPT-4o (2024-08-06)49.4
9O1 Mini44.9
10GPT-4 Preview (0125)33.7
11DeepSeek V2.531.5

Interactive version: theaggregate.ai/benchmark?slug=aider-refactoring-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.