GPT-5.4 Pro (xHigh): benchmark results
GPT-5.4 Pro evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-03-06. Access: API.
Unified ELO 1729 ± 1, rank #52 of 1761 rated models, from 60 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LLMEval-Logic Formalization Fixed | 60.2 | Accuracy (%) | 100 |
| MathArena - ARXIV February | 75.78 | Accuracy (%) | 100 |
| OpenAI GPT-5.4 Launch - ARC-AGI-1 (Verified) | 94.5 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - ARC-AGI-2 (Verified) | 83.3 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - BrowseComp | 89.3 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - FinanceAgent v1.1 | 61.5 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - Frontier Science Research | 36.7 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - FrontierMath Tier 4 | 38 | Score (%) | 100 |
| OpenAI GPT-5.4 Launch - GPQA Diamond | 94.4 | Score (%) | 100 |
| OpenAI GPT-5.5 Launch - GPQA Diamond | 94.4 | Score (%) | 100 |
| GIM | 2.16 | IRT ability (theta) | 98.9 |
| AA CritPt | 30 | Accuracy (%) | 98.7 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-pro-xhigh · How It Works · Data refreshed daily, snapshot 2026-09-05.