GPT-5 Codex (High) — benchmark results

GPT-5 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-09-23. Access: API.

Unified ELO 1827 ± 29, rank #118 of 1776 rated models, from 47 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
WebCoderBench - Visual Experience93.83Score (%)100
AA AIME 202598.67Accuracy (%)99.3
AA MMLU-Pro86.49Accuracy (%)95.6
AA LiveCodeBench84.02Pass@1 (%)95.3
WebCoderBench - Functionality Correctness74.82Score (%)92.3
AA IFBench74.15Accuracy (%)92
AA Omniscience - Software Engineering (SWE) - Swift72Accuracy (%)91.7
AA Omniscience - Business36.7Accuracy (%)91.5
AA Long Context Reasoning69Accuracy (%)91
AA Omniscience - Law34.5Accuracy (%)89.3
AA Omniscience - Software Engineering (SWE) - Java42Accuracy (%)88.8
AA Omniscience - Software Engineering (SWE) - Dart44Accuracy (%)88.2

Interactive version: theaggregate.ai/model?slug=gpt-5-codex-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.