GPT-5 Codex (High): benchmark results

GPT-5 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-09-23. Access: API.

Unified ELO 1653 ± 1, rank #233 of 1761 rated models, from 46 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
WebCoderBench - Visual Experience93.83Score (%)100
AA AIME 202598.67Accuracy (%)99.4
AA Omniscience - Software Engineering (SWE) - Java42Accuracy (%)97.6
AA Omniscience - Software Engineering (SWE) - Dart42Accuracy (%)96.4
AA Omniscience - Software Engineering (SWE) - JavaScript55.45Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - Kotlin46Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - Swift64Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - PHP54Accuracy (%)95.7
AA LiveCodeBench84.02Pass@1 (%)95.6
AA MMLU-Pro86.49Accuracy (%)95
AA Omniscience - Software Engineering (SWE) - R38Accuracy (%)93.7
AA Omniscience - Software Engineering (SWE) - TypeScript48.89Accuracy (%)93.3

Interactive version: theaggregate.ai/model?slug=gpt-5-codex-high · How It Works · Data refreshed daily, snapshot 2026-09-05.