GameXpert-Bench - GameFix - avg@3 (All Bugs Fixed): leaderboard

Metric: Tasks with every injected bug fixed per run (of 100; mean of three runs). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Claude Code + Claude Opus 5 (Max Effort)22.3
2Claude Code + Claude Fable 5 (Max Effort)18
3Codex + GPT-5.6 Sol (xHigh)17
4Claude Code + GPT-5.6 Sol (xHigh)14
5Codex + GPT-5.5 (xHigh)7.3
6Claude Code + Claude Opus 4.8 (Max Effort)7
7Claude Code + GPT-5.5 (xHigh)6.7
8Claude Code + Claude Opus 4.7 (Max Effort)5.7
9Claude Code + Gemini 3.5 Flash (High)5.7
10Claude Code + GLM 5.2 (xHigh)5.3

Interactive version: theaggregate.ai/benchmark?slug=gamexpert-bench-gamefix-avg-3-all-bugs-fixed · How It Works · Data refreshed daily, snapshot 2026-09-19.