GPT-5.4 (2026-03-05) (High): benchmark results

Provider: OpenAI. Released 2026-03-05. Access: API.

Unified ELO 1792 ± 15, rank #157 of 2131 rated models, from 102 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenCompass LLM - Average (CompassBench 2604)67.3Score (%)100
OpenCompass LLM - Language (CompassBench 2604)80.2Score (%)100
OpenCompass Language - Creation (CompassBench 2604)82.5Score (%)100
OpenCompass Language - NLP (CompassBench 2604)74.6Score (%)100
OpenCompass Reasoning - Academic (CompassBench 2604)52Score (%)100
Nejumi 4 - Toxicity - Social Norms99.6Criteria met (%)98.6
Nejumi 4 - JTruthfulQA76.8Score (%)97.5
Nejumi 4 - jaster (0-shot) - JMMLU96Exact match (%)96.8
Nejumi 4 - jaster (2-shot) - JEMHopQA71.25Character F1 (x100)95.7
OpenCompass Code - Comprehensive (CompassBench 2604)63.4Score (%)95.5
OpenCompass Knowledge - Engineering (CompassBench 2604)96.2Score (%)95.5
OpenCompass LLM - Agent (CompassBench 2604)52.8Score (%)95.5

Interactive version: theaggregate.ai/model?slug=gpt-5-4-2026-03-05-high · How It Works · Data refreshed daily, snapshot 2026-10-09.