GPT-5.4 Mini (xHigh) — benchmark results
GPT-5.4 Mini evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-03-17. Access: API.
Unified ELO 1810 ± 16, rank #131 of 1776 rated models, from 81 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Terminal-Bench Hard | 52.27 | Accuracy (%) | 95.7 |
| AA Global-MMLU-Lite - Burmese | 88.42 | Accuracy (%) | 93.6 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 64 | Accuracy (%) | 93.3 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 71.82 | Accuracy (%) | 92.5 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 68.89 | Accuracy (%) | 92.3 |
| AA SciCode | 49.88 | Accuracy (%) | 92 |
| AA Long Context Reasoning | 69.33 | Accuracy (%) | 91.7 |
| AA CritPt | 10 | Accuracy (%) | 91.6 |
| AA Omniscience - Software Engineering (SWE) - R | 52 | Accuracy (%) | 91 |
| AA IFBench | 73.27 | Accuracy (%) | 90.6 |
| AA Global-MMLU-Lite - Swahili | 88.33 | Accuracy (%) | 90.5 |
| AA Omniscience - Software Engineering (SWE) - Python | 63.5 | Accuracy (%) | 90.3 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-mini-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.