GameXpert-Bench - GameFix - avg@3 (All Bugs Fixed): leaderboard
Metric: Tasks with every injected bug fixed per run (of 100; mean of three runs). Source: arxiv.org. 17 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Code + Claude Opus 5 (Max Effort) | 22.3 |
| 2 | Claude Code + Claude Fable 5 (Max Effort) | 18 |
| 3 | Codex + GPT-5.6 Sol (xHigh) | 17 |
| 4 | Claude Code + GPT-5.6 Sol (xHigh) | 14 |
| 5 | Codex + GPT-5.5 (xHigh) | 7.3 |
| 6 | Claude Code + Claude Opus 4.8 (Max Effort) | 7 |
| 7 | Claude Code + GPT-5.5 (xHigh) | 6.7 |
| 8 | Claude Code + Claude Opus 4.7 (Max Effort) | 5.7 |
| 9 | Claude Code + Gemini 3.5 Flash (High) | 5.7 |
| 10 | Claude Code + GLM 5.2 (xHigh) | 5.3 |
Interactive version: theaggregate.ai/benchmark?slug=gamexpert-bench-gamefix-avg-3-all-bugs-fixed · How It Works · Data refreshed daily, snapshot 2026-09-19.