Sphinx - Python: leaderboard

Metric: Checklist Coverage Score (%; GPT-4o judge, 450 buggy + 50 bug-free PRs per language). Source: arxiv.org. Saturation forecast: Estimated already saturated. 29 models tracked.

Top models

#ModelScore
1GPT-4.142.4
2O4 Mini40.81
3Gemini 2.5 Pro40.8
4O3 Mini39.73
5Qwen 3 235B A22B38.88
6Claude 3.7 Sonnet38.2
7Qwen 2.5 72B Instruct38.13
8Qwen 3 30B A3B38.08
9GPT-4o (2024-08-06)37.15
10Claude 3.5 Sonnet36.95
11GPT-4o Mini36.73
12DeepSeek V332.99
13GPT-4.1 Mini32.78
14DeepSeek R132.6
15Qwen 3 32B32.15

Interactive version: theaggregate.ai/benchmark?slug=sphinx-python · How It Works · Data refreshed daily, snapshot 2026-09-25.