Pencil Puzzle Bench - Light Up — leaderboard

Metric: Direct-ask Success Rate (%). Source: ppbench.com. 51 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Thinking)66.7
2Gemini 3.1 Pro (Preview)53.3
3Kimi K2.533.3
4GPT-5.2 (High)33.3
5GPT-5.2 (xHigh)33.3
6GPT-5.2 (Medium)20
7Gemini 3 Pro (High)20
8Gemini 3 Pro13.3
9Claude Opus 4.5 (Thinking)13.3
10GPT-5.1 (Medium)13.3
11Claude Sonnet 4.6 (Thinking)13.3
12Grok 4.1 Fast (Reasoning)6.7
13Grok 4.1 Fast6.7
14DeepSeek V3.2 Speciale6.7
15GPT-5.2 Pro6.7

Interactive version: theaggregate.ai/benchmark?slug=pencil-puzzle-bench-light-up · How the rankings work · Data refreshed daily, snapshot 2026-07-22.