GPT-5.4 (Codex): benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1765 ± 16, rank #132 of 1605 rated models, from 38 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CyberChainBench - Exploit43.3Exploit reward (%; min(agent profit / reference profit, 1) f88.9
Herculean - Auditing (Codex)63.08Accuracy (%; share of the 65 SEC XBRL audit instances where 83.3
CliniCARE-Bench - Defect-Free Accuracy65.6Correct verdicts whose report has no judged defect (%)76.7
DrawAI-Bench - Editability - Formula97.8Editability score (0-100; rules and VLM rubric, strongest ob75
CliniCARE-Bench - Expected Calibration Error0.15Expected calibration error (0-1; lower is better)73.3
CliniCARE-Bench - Over-Commitment Rate36.7Definitive verdicts on cases whose reference requires deferr73.3
CliniCARE-Bench - Process Rubric Score76.1Process rubric score (%; GPT-5.5 judge)73.3
CyberChainBench - Detect32.5Detection reward (%; 1 when both the root-cause vulnerabilit66.7
CyberChainBench - Patch19.1Patch reward (%; 1 when the patched implementation makes the66.7
DrawAI-Bench - Fidelity - Shape92Fidelity score (0-100; rules and VLM rubric, strongest obser66.7
PatchEval-Verified78.7Pass@1 (%)62.5
SkillSafetyBench - Memory, Recovery, Audit and Persistence46.2Attack success rate (%; 26 cases of unsafe state that persis62.5

Interactive version: theaggregate.ai/model?slug=gpt-5-4-codex · How It Works · Data refreshed daily, snapshot 2026-09-26.