GPT-5.4 (Thinking): benchmark results
GPT-5.4 evaluated with thinking enabled. Provider: OpenAI. Released 2026-03-06. Access: API.
Unified ELO 1701 ± 1, rank #106 of 1761 rated models, from 12 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HalluHard | 0.41 | Turn-1 Hallucination Rate | 100 |
| MMCL-Bench | 26.5 | Overall (self-reported) | 100 |
| OpenAI GPT-5.5 System Card - Hard Negative Protein Binding Prediction | 3.46 | pass@4 (%) | 100 |
| BenchTable | 72.8 | Total Score (%) | 90.1 |
| IUMB | 81.2 | Score (%) | 87 |
| OpenAI GPT-5.6 System Card - Hard Negative Protein Binding Prediction | 3.5 | pass@4 (%) | 66.7 |
| OpenAI CTF (Professional) | 88.23 | pass@12 (%) | 50 |
| OpenAI Cyber Ranges | 73.33 | Combined Pass Rate (%) | 33.3 |
| CVE-Bench | 86.27 | pass@1 (%) | 0 |
| OpenAI GPT-5.5 System Card - Biochemistry Knowledge Improvement | 30.97 | reward@4 (%) | 0 |
| OpenAI GPT-5.5 System Card - DNA Sequence Design for TF Binding | 12.82 | pass@1 (%) | 0 |
| OpenAI GPT-5.6 System Card - DNA Sequence Design for TF Binding | 12.82 | pass@1 (%) | 0 |
Interactive version: theaggregate.ai/model?slug=gpt-5-4-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.