A2Z GameSpec-Bench - Scenario Replay Big: leaderboard

Metric: Scenario Replay Big (%; coding-agent game design fidelity; Table 2). Source: a2z-gamespec-bench.github.io. Saturation forecast: Around March 2028. 9 models tracked.

Top models

#ModelScore
1Claude Fable 5.155.1
2Claude Opus 554.4
3GPT-6 Astra52.1
4GPT-5.6 Sol48.3
5GPT-5.542.5
6Claude Opus 4.841.4
7GLM-5.334.5
8DeepSeek V4 Pro25.9

Interactive version: theaggregate.ai/benchmark?slug=a2z-gamespec-bench-scenario-replay-big · How It Works · Data refreshed daily, snapshot 2026-10-10.