Game Agent Coding League — leaderboard

LLMs compete in 7 classic board games (Battleship, Tic-Tac-Toe, Connect4, Wizard, WordMatrix, MiniChess, Surround Morris). Overall weighted score measures game-playing ability.

Metric: Weighted Score (0-100). Source: gameagentcodingleague.com. Status: saturation imminent. 21 models tracked.

Top models

#ModelScore
1GPT-5.573.21
2GPT-5.471.93
3Claude Opus 4.766.96
4Gemini 3.1 Pro (Preview)62.79
5Claude Opus 4.662.32
6GLM-5.161.39
7Kimi K2.661.09
8Claude Sonnet 4.659.71
9MiMo-V2.5-Pro58.22
10DeepSeek V4 Pro57.74
11Qwen 3.6 Plus53.16
12Gemini 3 Flash (Preview)51.55
13Qwen 3.6 Max Preview49.26
14GPT-5.4 Mini49.09
15DeepSeek V4 Flash46.02

Interactive version: theaggregate.ai/benchmark?slug=game-agent-coding-league · How the rankings work · Data refreshed daily, snapshot 2026-07-22.