GameXpert-Bench - GameFix - pass^3 (All Bugs Fixed): leaderboard

Metric: Tasks with every injected bug fixed in all three runs (of 100). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Claude Code + Claude Opus 5 (Max Effort)14
2Codex + GPT-5.6 Sol (xHigh)13
3Claude Code + Claude Fable 5 (Max Effort)10
4Claude Code + GPT-5.6 Sol (xHigh)6
5Claude Code + Claude Opus 4.8 (Max Effort)3
6Claude Code + Gemini 3.5 Flash (High)3
7Codex + GPT-5.5 (xHigh)2
8Claude Code + GPT-5.5 (xHigh)2
9Claude Code + Kimi K3 (Max Effort)2
10Claude Code + GLM 5.2 (xHigh)2

Interactive version: theaggregate.ai/benchmark?slug=gamexpert-bench-gamefix-pass-pow-3-all-bugs-fixed · How It Works · Data refreshed daily, snapshot 2026-09-19.