GPT-5.3 Codex (High): benchmark results

GPT-5.3 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2026-02-05. Access: API.

Unified ELO 1719 ± 1, rank #65 of 1761 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SlopCodeBench26.02Isolated Solved (%)93.8
Vals AI Terminal-Bench 2.064.05Accuracy (%)92.4
APEX-Agents46.9Mean Score (ReAct) (self-reported)86.4
PrinzBench52Score (x/99)69.6
BinaryAudit82.46Avg Success Rate (%)68
InferenceBench5.49Speedup Score54.8
LiveBench73.18LiveBench average (self-reported)51.1

Interactive version: theaggregate.ai/model?slug=gpt-5-3-codex-high · How It Works · Data refreshed daily, snapshot 2026-09-05.