GPT-5.3 Codex: benchmark results
OpenAI's Codex-specialized GPT-5.3 model for coding and software-agent workloads. Provider: OpenAI. Released 2026-02-05. Access: API.
Unified ELO 1699 ± 1, rank #54 of 1392 rated models, from 94 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AISI Cyber CTF | 75 | Success Rate (%) | 100 |
| BinaryAudit | 94.12 | Avg Success Rate (%) | 100 |
| EVMbench | 51 | Avg Score (Detect+Patch+Exploit) (%) | 100 |
| Kotlin-bench | 49 | Pass Rate (%) | 100 |
| SWE-Lancer (Diamond) | 81.4 | Score (%) | 100 |
| Time to REFLECT | 47.5 | Overall (Report Quality) (self-reported) | 100 |
| LM Market Cap LMC Score | 90.5 | LMC Score (0-100) | 94.5 |
| BenchmarkList ECI | 146.36 | Capability Index (ECI) | 93.5 |
| YapBench | 64.8 | YapIndex (lower is better) | 93.2 |
| SRE Skills Bench - IAM | 98.4 | Accuracy (%) | 92.9 |
| SRE Skills Bench - S3 | 100 | Accuracy (%) | 92.9 |
| SnakeBench | 32.7 | TrueSkill Rating | 92.6 |
Interactive version: theaggregate.ai/model?slug=gpt-5-3-codex · How It Works · Data refreshed daily, snapshot 2026-09-05.