GPT-5.4 Pro (xHigh) — benchmark results
GPT-5.4 Pro evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-03-06. Access: API.
Unified ELO 2019 ± 27, rank #17 of 1776 rated models, from 65 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EnigmaEval | 23.82 | Score (self-reported) | 100 |
| LLMEval-Logic Formalization Fixed | 60.2 | Accuracy (%) | 100 |
| MathArena - ARXIV February | 75.78 | Accuracy (%) | 100 |
| OpenAI GPT-5.4 Launch - ARC-AGI-1 (Verified) | 94.5 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - ARC-AGI-2 (Verified) | 83.3 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - BrowseComp | 89.3 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - FinanceAgent v1.1 | 61.5 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - Frontier Science Research | 36.7 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - FrontierMath Tier 1-3 | 50 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - FrontierMath Tier 4 | 38 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - GPQA Diamond | 94.4 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - Humanity's Last Exam (no tools) | 42.7 | Score (%) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-pro-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.