Sphinx: leaderboard

Metric: Checklist Coverage Score (%; GPT-4o judge, 450 buggy + 50 bug-free PRs per language). Source: arxiv.org. Saturation forecast: Estimated already saturated. 29 models tracked.

Top models

#ModelScore
1GPT-4.134.23
2Gemini 2.5 Pro32.75
3O4 Mini32.01
4Claude 3.7 Sonnet31.39
5O3 Mini30.84
6Qwen 2.5 72B Instruct30.53
7Claude 3.5 Sonnet29.81
8Qwen 3 235B A22B29.67
9GPT-4o (2024-08-06)29.4
10Qwen 3 30B A3B29.14
11GPT-4o Mini28.84
12GPT-4.1 Mini26.74
13DeepSeek V326.45
14Qwen 3 32B26.06
15DeepSeek R125.6

Interactive version: theaggregate.ai/benchmark?slug=sphinx · How It Works · Data refreshed daily, snapshot 2026-09-25.