GPT-5.3 Codex (xHigh) — benchmark results

GPT-5.3 Codex evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-02-05. Access: API.

Unified ELO 1929 ± 28, rank #49 of 1776 rated models, from 44 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - JavaScript90.91Accuracy (%)100
AA Omniscience - Software Engineering (SWE) - Dart80Accuracy (%)99.8
AA Omniscience - Software Engineering (SWE) - Java73Accuracy (%)99.8
AA Omniscience - Software Engineering (SWE) - Kotlin90Accuracy (%)99.8
AA Omniscience - Software Engineering (SWE) - Julia84Accuracy (%)99.4
AA Omniscience - Software Engineering (SWE) - Rust86Accuracy (%)99.2
AA Omniscience - Software Engineering (SWE)83.8Accuracy (%)99
AA Omniscience - Software Engineering (SWE) - TypeScript90Accuracy (%)98.8
AA Omniscience - Software Engineering (SWE) - Python87.5Accuracy (%)98.7
ALE-Bench1655.22Performance (Self-Refine x1) (self-reported)98.7
AA Omniscience - Software Engineering (SWE) - HTML86Accuracy (%)98.5
AA Long Context Reasoning74Accuracy (%)98.3

Interactive version: theaggregate.ai/model?slug=gpt-5-3-codex-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.