LLM Grid Game Benchmark — leaderboard
Metric: Avg Win Rate vs Random (%). Source: research-outcome.github.io. 7 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4o | 72.2 |
| 2 | Claude 3 Sonnet (20240229) | 61.1 |
| 3 | Claude 3.5 Sonnet (20240620) | 58.9 |
| 4 | Gemini 1.5 Pro | 58.9 |
| 5 | Gemini 1.5 Flash | 58.9 |
| 6 | GPT-4 Turbo | 51.1 |
Interactive version: theaggregate.ai/benchmark?slug=llm-grid-game-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.