A2Z GameSpec-Bench - Source Code Big: leaderboard

Metric: Source Code Big (%; coding-agent game design fidelity; Table 2). Source: a2z-gamespec-bench.github.io. Saturation forecast: Around January 2027. 9 models tracked.

Top models

#ModelScore
1Claude Fable 5.183.5
2Claude Opus 578.4
3GPT-6 Astra74.4
4GLM-5.358.1
5GPT-5.555.9
6DeepSeek V4 Pro53.8
7Claude Opus 4.849.6
8GPT-5.6 Sol46.3

Interactive version: theaggregate.ai/benchmark?slug=a2z-gamespec-bench-source-code-big · How It Works · Data refreshed daily, snapshot 2026-10-10.