A2Z GameSpec-Bench - Source Code Small: leaderboard

Metric: Source Code Small (%; coding-agent game design fidelity; Table 2). Source: a2z-gamespec-bench.github.io. Saturation forecast: Around January 2027. 9 models tracked.

Top models

#ModelScore
1Claude Fable 5.189.7
2Claude Opus 587.9
3GPT-6 Astra84.2
4GPT-5.581
5GLM-5.378.6
6GPT-5.6 Sol78.5
7DeepSeek V4 Pro75.7
8Claude Opus 4.872.5

Interactive version: theaggregate.ai/benchmark?slug=a2z-gamespec-bench-source-code-small · How It Works · Data refreshed daily, snapshot 2026-10-10.