GPT-5.4 (2026-03-05) (High): benchmark results
Provider: OpenAI. Released 2026-03-05. Access: API.
Unified ELO 1792 ± 15, rank #157 of 2131 rated models, from 102 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenCompass LLM - Average (CompassBench 2604) | 67.3 | Score (%) | 100 |
| OpenCompass LLM - Language (CompassBench 2604) | 80.2 | Score (%) | 100 |
| OpenCompass Language - Creation (CompassBench 2604) | 82.5 | Score (%) | 100 |
| OpenCompass Language - NLP (CompassBench 2604) | 74.6 | Score (%) | 100 |
| OpenCompass Reasoning - Academic (CompassBench 2604) | 52 | Score (%) | 100 |
| Nejumi 4 - Toxicity - Social Norms | 99.6 | Criteria met (%) | 98.6 |
| Nejumi 4 - JTruthfulQA | 76.8 | Score (%) | 97.5 |
| Nejumi 4 - jaster (0-shot) - JMMLU | 96 | Exact match (%) | 96.8 |
| Nejumi 4 - jaster (2-shot) - JEMHopQA | 71.25 | Character F1 (x100) | 95.7 |
| OpenCompass Code - Comprehensive (CompassBench 2604) | 63.4 | Score (%) | 95.5 |
| OpenCompass Knowledge - Engineering (CompassBench 2604) | 96.2 | Score (%) | 95.5 |
| OpenCompass LLM - Agent (CompassBench 2604) | 52.8 | Score (%) | 95.5 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-2026-03-05-high · How It Works · Data refreshed daily, snapshot 2026-10-09.