Sphinx - JavaScript: leaderboard

Metric: Checklist Coverage Score (%; GPT-4o judge, 450 buggy + 50 bug-free PRs per language). Source: arxiv.org. Saturation forecast: Estimated already saturated. 29 models tracked.

Top models

#ModelScore
1GPT-4.121.82
2Qwen 2.5 72B Instruct21.42
3Phi-421.4
4Gemini 2.5 Pro21.3
5O4 Mini20.47
6Qwen 3 32B19.71
7Claude 3.7 Sonnet19.48
8Qwen 3 235B A22B19.3
9Qwen 3 30B A3B18.62
10Claude 3.5 Sonnet18.24
11GPT-4o (2024-08-06)18.23
12O3 Mini18.03
13GPT-4o Mini17.98
14DeepSeek V316.94
15DeepSeek R116.74

Interactive version: theaggregate.ai/benchmark?slug=sphinx-javascript · How It Works · Data refreshed daily, snapshot 2026-09-25.