GPT-5.3 Codex: benchmark results

OpenAI's Codex-specialized GPT-5.3 model for coding and software-agent workloads. Provider: OpenAI. Released 2026-02-05. Access: API.

Unified ELO 1699 ± 1, rank #54 of 1392 rated models, from 94 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AISI Cyber CTF75Success Rate (%)100
BinaryAudit94.12Avg Success Rate (%)100
EVMbench51Avg Score (Detect+Patch+Exploit) (%)100
Kotlin-bench49Pass Rate (%)100
SWE-Lancer (Diamond)81.4Score (%)100
Time to REFLECT47.5Overall (Report Quality) (self-reported)100
LM Market Cap LMC Score90.5LMC Score (0-100)94.5
BenchmarkList ECI146.36Capability Index (ECI)93.5
YapBench64.8YapIndex (lower is better)93.2
SRE Skills Bench - IAM98.4Accuracy (%)92.9
SRE Skills Bench - S3100Accuracy (%)92.9
SnakeBench32.7TrueSkill Rating92.6

Interactive version: theaggregate.ai/model?slug=gpt-5-3-codex · How It Works · Data refreshed daily, snapshot 2026-09-05.