GPT-5.4 (2026-03-05) (xHigh): benchmark results

Provider: OpenAI. Released 2026-03-05. Access: API.

Unified ELO 1816 ± 12, rank #112 of 2131 rated models, from 136 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Horangi 4 - IFEval-Ko95Instruction-following accuracy (%)100
RuVerBench - Agentic Coding89.4Balanced Accuracy (%)100
Nejumi 4 - jaster (0-shot) - JBLiMP98Exact match (%)99.6
Horangi 4 - SWE-bench Verified (80-task subset)73.75Resolved (%)99.5
Nejumi 4 - jaster (0-shot) - JMMLU97Exact match (%)98.9
Horangi 4 - GLP - Coding76.92Score (%)98.3
Nejumi 4 - ARC-AGI-284Accuracy (%)97.2
Horangi 4 - Ko-ARC-AGI95Accuracy (%)97.1
Horangi 4 - GLP - Mathematical Reasoning97.5Score (%)96.6
Horangi 4 - Ko-HLE47Accuracy (%)96.6
Nejumi 4 - jaster (0-shot) - AIO94.62Character F1 (x100)96.5
Nejumi 4 - jaster (2-shot) - JEMHopQA71.29Character F1 (x100)96.5

Interactive version: theaggregate.ai/model?slug=gpt-5-4-2026-03-05-xhigh · How It Works · Data refreshed daily, snapshot 2026-10-09.