PDB-Single - Edit Precision: leaderboard

Metric: Edit-level precision (%): share of a model's predicted edits that match an essential ground-truth fix, on the PDB-Single-Full set of single-bug programs; higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)78.1
2Gemini 2.5 Pro77.9
3Qwen 3 Coder 480B A35B73.5
4Kimi K265.8
5Grok Code Fast 163.8
6Kimi K2 (Thinking)61.3
7DeepSeek V3.258.6
8DeepSeek V3.2 (Thinking)56
9GPT-5.1 Codex50.3

Interactive version: theaggregate.ai/benchmark?slug=pdb-single-edit-precision · How It Works · Data refreshed daily, snapshot 2026-10-07.