Sphinx - Java: leaderboard

Metric: Checklist Coverage Score (%; GPT-4o judge, 450 buggy + 50 bug-free PRs per language). Source: arxiv.org. Saturation forecast: Estimated already saturated. 29 models tracked.

Top models

#ModelScore
1GPT-4.126.46
2Gemini 2.5 Pro26.31
3Claude 3.7 Sonnet25.92
4Qwen 2.5 72B Instruct24.94
5Phi-424.53
6O3 Mini23.84
7O4 Mini23.82
8Qwen 3 235B A22B23.36
9Claude 3.5 Sonnet23.07
10GPT-4o (2024-08-06)22.93
11GPT-4o Mini22.56
12DeepSeek V322.34
13Qwen 3 30B A3B21.96
14GPT-4.1 Nano21.88
15GPT-4.1 Mini21.57

Interactive version: theaggregate.ai/benchmark?slug=sphinx-java · How It Works · Data refreshed daily, snapshot 2026-09-25.