GPT-5.4 — benchmark results

OpenAI's standard GPT-5.4 model for general-purpose reasoning, coding, and writing. Provider: OpenAI. Released 2026-03-06. Access: API.

Unified ELO 1822 ± 9, rank #122 of 1776 rated models, from 694 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - Brainstorming0.97JRT z-score100
AGC-Bench - STEM0.81JRT z-score100
AGC-Bench - Story / Narrative0.89JRT z-score100
AGC-Bench - irfl1.59Dataset z-score100
AGC-Bench - permpst2.14Dataset z-score100
AGC-Bench - pollux_creativity1.22Dataset z-score100
AGC-Bench - ss_gen1.51Dataset z-score100
BehaviorBench31.4Game Behav. Sim. (W ↓) (self-reported)100
CPCD-Bench4.78SR (LLM-as-a-Judge) (self-reported)100
CUDABeaver29.1pass@5 (self-reported)100
CUSP Science60.3FRQ Pass (%)100
ChildAgentEval53Total (self-reported)100

Interactive version: theaggregate.ai/model?slug=gpt-5-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.