GPT-5.4: benchmark results
OpenAI's standard GPT-5.4 model for general-purpose reasoning, coding, and writing. Provider: OpenAI. Released 2026-03-06. Access: API.
Unified ELO 1704 ± 1, rank #48 of 1392 rated models, from 795 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - Brainstorming | 0.97 | JRT z-score | 100 |
| AGC-Bench - STEM | 0.81 | JRT z-score | 100 |
| AGC-Bench - Story / Narrative | 0.89 | JRT z-score | 100 |
| AGC-Bench - irfl | 1.59 | Dataset z-score | 100 |
| AGC-Bench - permpst | 2.14 | Dataset z-score | 100 |
| AGC-Bench - pollux_creativity | 1.22 | Dataset z-score | 100 |
| AGC-Bench - ss_gen | 1.51 | Dataset z-score | 100 |
| CPCD-Bench | 4.78 | SR (LLM-as-a-Judge) (self-reported) | 100 |
| CUDABeaver | 29.1 | pass@5 (self-reported) | 100 |
| CUSP Science | 60.3 | FRQ Pass (%) | 100 |
| ChildAgentEval | 53 | Total (self-reported) | 100 |
| ClawsBench - Capability | 78.16 | Best-configuration Score (-100 to 100) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4 · How It Works · Data refreshed daily, snapshot 2026-09-05.