GPT-5.3 Codex — benchmark results
OpenAI's Codex-specialized GPT-5.3 model for coding and software-agent workloads. Provider: OpenAI. Released 2026-02-05. Access: API.
Unified ELO 1835 ± 19, rank #111 of 1776 rated models, from 91 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AISI Cyber CTF | 75 | Success Rate (%) | 100 |
| BinaryAudit | 94.12 | Avg Success Rate (%) | 100 |
| EVMbench | 51 | Avg Score (Detect+Patch+Exploit) (%) | 100 |
| Kotlin-bench | 49 | Pass Rate (%) | 100 |
| SWE-Lancer (Diamond) | 81.4 | Score (%) | 100 |
| SmellBench | 47.8 | Weighted Effectiveness (E) (self-reported) | 100 |
| Time to REFLECT | 47.5 | Overall (Report Quality) (self-reported) | 100 |
| AA-LCR | 74 | Score (self-reported) | 98.3 |
| CritPt | 16.9 | Accuracy (self-reported) | 97.2 |
| Vals AI LiveCodeBench | 87.31 | Accuracy (%) | 94.5 |
| SRE Skills Bench - IAM | 98.4 | Accuracy (%) | 92.9 |
| SRE Skills Bench - S3 | 100 | Accuracy (%) | 92.9 |
Interactive version: theaggregate.ai/model?slug=gpt-5-3-codex · How the rankings work · Data refreshed daily, snapshot 2026-07-22.