Defects4J: leaderboard

Defects4J: Evaluates software-engineering agents on realistic issue resolution, repository navigation, testing, or maintenance workflows.

Metric: Defects4J Plausible @1 (self-reported). Source: benchmarklist.com. Status: saturated. 35 models tracked.

Top models

#ModelScore
1O4 Mini (2025-04-16) (High)53.8
2O3 Mini (2025-01-31) (High)48.8
3Claude 3.7 Sonnet (20250219)47.8
4DeepSeek R147.5
5GPT-4.145.2
6Claude 3.5 Sonnet (20241022)44.1
7Gemini 2.5 Flash (Preview 05-20)43.4
8DeepSeek V3 (0324)43
9Claude 3.5 Sonnet (20240620)41.5
10Gemini 2.5 Pro (Preview 03-25)41.4
11DeepSeek V339.9
12Gemini 1.5 Pro (002)36.4
13GPT-4o (2024-11-20)35
14Mistral Medium 334.9
15GPT-4o (2024-08-06)34.1

Interactive version: theaggregate.ai/benchmark?slug=defects4j · How It Works · Data refreshed daily, snapshot 2026-09-05.