GPT-5.4 (xHigh): benchmark results

GPT-5.4 evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-03-06. Access: API.

Unified ELO 1714 ± 1, rank #71 of 1761 rated models, from 165 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CLBench27.9Solving Rate (%)100
MathArena - ArXiv Math Jan 202676.09Accuracy (%)100
PlanningBench63.17All-pass (%) (self-reported)100
Sandboxed Coding Agents are Competitive Omni-m75OmniGAIA Avg. (self-reported)100
VideoMME w sub.89.5Score (self-reported)100
LiveBench Theory of Mind88.46Score99.1
NonoBench63.3Overall Accuracy (%)98.9
UGI - Natural Intelligence73.53NatInt Score98.8
LiveBench80.91LiveBench average (self-reported)97.9
APEX-Agents52.7Mean Score (ReAct) (self-reported)97.7
UGI - Writing68.65Writing Score97.7
AA Terminal-Bench Hard57.58Accuracy (%)97.3

Interactive version: theaggregate.ai/model?slug=gpt-5-4-xhigh · How It Works · Data refreshed daily, snapshot 2026-09-05.