GPT-5.4 (Thinking) — benchmark results
GPT-5.4 evaluated with thinking enabled. Provider: OpenAI. Released 2026-03-06. Access: API.
Unified ELO 1883 ± 31, rank #75 of 1776 rated models, from 9 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HalluHard | 0.41 | Turn-1 Hallucination Rate | 100 |
| OpenAI GPT-5.5 System Card - Hard Negative Protein Binding Prediction | 3.46 | pass@4 (%) | 100 |
| BenchTable | 72.8 | Total Score (%) | 90.1 |
| IUMB | 81.2 | Score (%) | 85.5 |
| OpenAI CTF (Professional) | 88.23 | pass@12 (%) | 50 |
| OpenAI Cyber Ranges | 73.33 | Combined Pass Rate (%) | 33.3 |
| CVE-Bench | 86.27 | pass@1 (%) | 0 |
| OpenAI GPT-5.5 System Card - Biochemistry Knowledge Improvement | 30.97 | reward@4 (%) | 0 |
| OpenAI GPT-5.5 System Card - DNA Sequence Design for TF Binding | 12.82 | pass@1 (%) | 0 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.