GPT-5.4 (Thinking) — benchmark results

GPT-5.4 evaluated with thinking enabled. Provider: OpenAI. Released 2026-03-06. Access: API.

Unified ELO 1883 ± 31, rank #75 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HalluHard0.41Turn-1 Hallucination Rate100
OpenAI GPT-5.5 System Card - Hard Negative Protein Binding Prediction3.46pass@4 (%)100
BenchTable72.8Total Score (%)90.1
IUMB81.2Score (%)85.5
OpenAI CTF (Professional)88.23pass@12 (%)50
OpenAI Cyber Ranges73.33Combined Pass Rate (%)33.3
CVE-Bench86.27pass@1 (%)0
OpenAI GPT-5.5 System Card - Biochemistry Knowledge Improvement30.97reward@4 (%)0
OpenAI GPT-5.5 System Card - DNA Sequence Design for TF Binding12.82pass@1 (%)0

Interactive version: theaggregate.ai/model?slug=gpt-5-4-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.