GPT-5.4 — benchmark results
OpenAI's standard GPT-5.4 model for general-purpose reasoning, coding, and writing. Provider: OpenAI. Released 2026-03-06. Access: API.
Unified ELO 1822 ± 9, rank #122 of 1776 rated models, from 694 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - Brainstorming | 0.97 | JRT z-score | 100 |
| AGC-Bench - STEM | 0.81 | JRT z-score | 100 |
| AGC-Bench - Story / Narrative | 0.89 | JRT z-score | 100 |
| AGC-Bench - irfl | 1.59 | Dataset z-score | 100 |
| AGC-Bench - permpst | 2.14 | Dataset z-score | 100 |
| AGC-Bench - pollux_creativity | 1.22 | Dataset z-score | 100 |
| AGC-Bench - ss_gen | 1.51 | Dataset z-score | 100 |
| BehaviorBench | 31.4 | Game Behav. Sim. (W â) (self-reported) | 100 |
| CPCD-Bench | 4.78 | SR (LLM-as-a-Judge) (self-reported) | 100 |
| CUDABeaver | 29.1 | pass@5 (self-reported) | 100 |
| CUSP Science | 60.3 | FRQ Pass (%) | 100 |
| ChildAgentEval | 53 | Total (self-reported) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.