GPT-5.4 (xHigh) — benchmark results

GPT-5.4 evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-03-06. Access: API.

Unified ELO 1997 ± 21, rank #25 of 1776 rated models, from 122 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CLBench27.9Solving Rate (%)100
MathArena - ArXiv Math Jan 202676.09Accuracy (%)100
PlanningBench63.17All-pass (%) (self-reported)100
Sandboxed Coding Agents are Competitive Omni-m75OmniGAIA Avg. (self-reported)100
AA Omniscience - Software Engineering (SWE) - Python90Accuracy (%)99.6
AA Omniscience - Software Engineering (SWE) - Julia84Accuracy (%)99.4
AA Omniscience - Software Engineering (SWE) - TypeScript91.11Accuracy (%)99.4
AA Omniscience - Software Engineering (SWE) - Java71Accuracy (%)99.2
ZeroBench23Score (%)99.2
AA SciCode56.6Accuracy (%)99.1
UGI - Natural Intelligence73.53NatInt Score99.1
AA Omniscience - Software Engineering (SWE) - JavaScript88.18Accuracy (%)99

Interactive version: theaggregate.ai/model?slug=gpt-5-4-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.