Sphinx - C#: leaderboard

Metric: Checklist Coverage Score (%; GPT-4o judge, 450 buggy + 50 bug-free PRs per language). Source: arxiv.org. Saturation forecast: Estimated already saturated. 29 models tracked.

Top models

#ModelScore
1O4 Mini40.01
2GPT-4.138.62
3Claude 3.7 Sonnet37.68
4Claude 3.5 Sonnet37.16
5Gemini 2.5 Pro36.75
6Qwen 2.5 72B Instruct35.06
7O3 Mini34.94
8GPT-4o (2024-08-06)34.32
9Qwen 3 235B A22B34.31
10GPT-4o Mini34.13
11Qwen 3 30B A3B33.03
12GPT-4.1 Mini32.38
13GPT-4.1 Nano32.14
14DeepSeek V331.39
15DeepSeek R130.09

Interactive version: theaggregate.ai/benchmark?slug=sphinx-c · How It Works · Data refreshed daily, snapshot 2026-09-25.