Pencil Puzzle Bench - LITS — leaderboard

Metric: Direct-ask Success Rate (%). Source: ppbench.com. 51 models tracked.

Top models

#ModelScore
1GPT-5.2 (xHigh)53.3
2GPT-5.2 (Medium)40
3Claude Opus 4.6 (Thinking)40
4GPT-5.2 (High)33.3
5Kimi K2.513.3
6Claude Opus 4.5 (Thinking)13.3
7Claude Sonnet 4.6 (Thinking)13.3
8Gemini 3.1 Pro (Preview)6.7
9Gemini 3 Pro6.7
10GPT-5 (Medium)6.7
11Grok 4.1 Fast6.7
12GPT-5.1 (Medium)6.7
13GPT-5.2 Pro6.7
14Gemini 3 Flash (High)6.7
15Gemini 2.5 Pro0

Interactive version: theaggregate.ai/benchmark?slug=pencil-puzzle-bench-lits · How the rankings work · Data refreshed daily, snapshot 2026-07-22.