GPT-5.4 (2026-03-05) (xHigh): benchmark results
Provider: OpenAI. Released 2026-03-05. Access: API.
Unified ELO 1816 ± 12, rank #112 of 2131 rated models, from 136 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Horangi 4 - IFEval-Ko | 95 | Instruction-following accuracy (%) | 100 |
| RuVerBench - Agentic Coding | 89.4 | Balanced Accuracy (%) | 100 |
| Nejumi 4 - jaster (0-shot) - JBLiMP | 98 | Exact match (%) | 99.6 |
| Horangi 4 - SWE-bench Verified (80-task subset) | 73.75 | Resolved (%) | 99.5 |
| Nejumi 4 - jaster (0-shot) - JMMLU | 97 | Exact match (%) | 98.9 |
| Horangi 4 - GLP - Coding | 76.92 | Score (%) | 98.3 |
| Nejumi 4 - ARC-AGI-2 | 84 | Accuracy (%) | 97.2 |
| Horangi 4 - Ko-ARC-AGI | 95 | Accuracy (%) | 97.1 |
| Horangi 4 - GLP - Mathematical Reasoning | 97.5 | Score (%) | 96.6 |
| Horangi 4 - Ko-HLE | 47 | Accuracy (%) | 96.6 |
| Nejumi 4 - jaster (0-shot) - AIO | 94.62 | Character F1 (x100) | 96.5 |
| Nejumi 4 - jaster (2-shot) - JEMHopQA | 71.29 | Character F1 (x100) | 96.5 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-2026-03-05-xhigh · How It Works · Data refreshed daily, snapshot 2026-10-09.