GPT-5.2 (xHigh): benchmark results

GPT-5.2 evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2025-12-11. Access: API.

Unified ELO 1700 ± 1, rank #108 of 1761 rated models, from 110 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Context-Bench Skills85.31Task Completion (%)100
Pencil Puzzle Bench - Firefly33.3Direct-ask Success Rate (%)100
Pencil Puzzle Bench - LITS53.3Direct-ask Success Rate (%)100
Pencil Puzzle Bench - Norinori93.3Direct-ask Success Rate (%)100
Pencil Puzzle Bench - Shikaku80Direct-ask Success Rate (%)100
Pencil Puzzle Bench - Sudoku20Direct-ask Success Rate (%)100
MathArena - HMMT Feb 2025100Accuracy (%)99.3
Pencil Puzzle Bench - Kurodoko6.7Direct-ask Success Rate (%)99
Pencil Puzzle Bench - Mashu60Direct-ask Success Rate (%)99
Pencil Puzzle Bench - Tapa60Direct-ask Success Rate (%)99
MathArena - AIME 2025100Accuracy (%)98.4
Vals AI AIME96.88Accuracy (%)98.4

Interactive version: theaggregate.ai/model?slug=gpt-5-2-xhigh · How It Works · Data refreshed daily, snapshot 2026-09-05.