GPT-5.4 (Thinking): benchmark results

GPT-5.4 evaluated with thinking enabled. Provider: OpenAI. Released 2026-03-06. Access: API.

Unified ELO 1701 ± 1, rank #106 of 1761 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HalluHard0.41Turn-1 Hallucination Rate100
MMCL-Bench26.5Overall (self-reported)100
OpenAI GPT-5.5 System Card - Hard Negative Protein Binding Prediction3.46pass@4 (%)100
BenchTable72.8Total Score (%)90.1
IUMB81.2Score (%)87
OpenAI GPT-5.6 System Card - Hard Negative Protein Binding Prediction3.5pass@4 (%)66.7
OpenAI CTF (Professional)88.23pass@12 (%)50
OpenAI Cyber Ranges73.33Combined Pass Rate (%)33.3
CVE-Bench86.27pass@1 (%)0
OpenAI GPT-5.5 System Card - Biochemistry Knowledge Improvement30.97reward@4 (%)0
OpenAI GPT-5.5 System Card - DNA Sequence Design for TF Binding12.82pass@1 (%)0
OpenAI GPT-5.6 System Card - DNA Sequence Design for TF Binding12.82pass@1 (%)0

Interactive version: theaggregate.ai/model?slug=gpt-5-4-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.