LMGame-Bench 2048 — leaderboard

LLM game-playing benchmark: 2048 puzzle testing numerical strategy and lookahead planning.

Metric: Score. Source: huggingface.co. Status: saturation imminent. 25 models tracked.

Top models

#ModelScore
1O1 (2024-12-17)7580
2O3 (2025-04-16)7120
3GPT-5 (High)5770.7
4Grok 44650.7
5O4 Mini (2025-04-16)4432
6Grok 3 Mini Beta4036
7Gemini 2.5 Pro (Preview 05-06)3586.7
8DeepSeek R1 05283330
9Claude Sonnet 4 (20250514)3136
10Claude Opus 4 (20250514)3036
11O1 Mini (2024-09-12)2757.3
12Claude 3.7 Sonnet (20250219)2624
13Qwen 3 235B A22B FP82144
14GPT-OSS-20B2040
15GPT-OSS-120B1973.3

Interactive version: theaggregate.ai/benchmark?slug=lmgame-bench-2048 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.