Sphinx - C++: leaderboard

Metric: Checklist Coverage Score (%; GPT-4o judge, 450 buggy + 50 bug-free PRs per language). Source: arxiv.org. Saturation forecast: Estimated already saturated. 29 models tracked.

Top models

#ModelScore
1GPT-4.141.85
2Gemini 2.5 Pro38.59
3O3 Mini37.68
4Claude 3.7 Sonnet35.68
5O4 Mini34.93
6GPT-4o (2024-08-06)34.39
7Qwen 3 30B A3B34.02
8Claude 3.5 Sonnet33.63
9Qwen 2.5 72B Instruct33.1
10GPT-4o Mini32.8
11Qwen 3 235B A22B32.51
12GPT-4.1 Nano31.48
13GPT-4.1 Mini31.38
14Qwen 3 32B29.99
15DeepSeek V328.58

Interactive version: theaggregate.ai/benchmark?slug=sphinx-c-plus-plus · How It Works · Data refreshed daily, snapshot 2026-09-25.