GPT-5.3 Codex — benchmark results

OpenAI's Codex-specialized GPT-5.3 model for coding and software-agent workloads. Provider: OpenAI. Released 2026-02-05. Access: API.

Unified ELO 1835 ± 19, rank #111 of 1776 rated models, from 91 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AISI Cyber CTF75Success Rate (%)100
BinaryAudit94.12Avg Success Rate (%)100
EVMbench51Avg Score (Detect+Patch+Exploit) (%)100
Kotlin-bench49Pass Rate (%)100
SWE-Lancer (Diamond)81.4Score (%)100
SmellBench47.8Weighted Effectiveness (E) (self-reported)100
Time to REFLECT47.5Overall (Report Quality) (self-reported)100
AA-LCR74Score (self-reported)98.3
CritPt16.9Accuracy (self-reported)97.2
Vals AI LiveCodeBench87.31Accuracy (%)94.5
SRE Skills Bench - IAM98.4Accuracy (%)92.9
SRE Skills Bench - S3100Accuracy (%)92.9

Interactive version: theaggregate.ai/model?slug=gpt-5-3-codex · How the rankings work · Data refreshed daily, snapshot 2026-07-22.