GameXpert-Bench - GameFix - Strict Repair Score: leaderboard

Metric: Share of tasks with at least t% of injected bugs fixed, averaged over three runs and t = 90-100 (0-100). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Claude Code + Claude Opus 5 (Max Effort)39
2Claude Code + Claude Fable 5 (Max Effort)33.7
3Codex + GPT-5.6 Sol (xHigh)29.1
4Claude Code + GPT-5.6 Sol (xHigh)26.7
5Claude Code + Claude Opus 4.8 (Max Effort)18
6Claude Code + Claude Opus 4.7 (Max Effort)17.2
7Codex + GPT-5.5 (xHigh)16.3
8Claude Code + GPT-5.5 (xHigh)16.1
9Claude Code + DeepSeek V4 Flash (Max Effort)15.2
10Claude Code + Kimi K3 (Max Effort)14

Interactive version: theaggregate.ai/benchmark?slug=gamexpert-bench-gamefix-strict-repair-score · How It Works · Data refreshed daily, snapshot 2026-09-19.