GPT-5 Codex — benchmark results

OpenAI's Codex-specialized GPT-5 model for coding and software-agent workloads. Provider: OpenAI. Released 2025-09-23. Access: API.

Unified ELO 1785 ± 36, rank #158 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AI Chess Leaderboard (Reasoning)1777Elo99
SnakeBench33.3TrueSkill Rating95.9
AA-LCR69Score (self-reported)92.7
AI Chess Leaderboard (Continuation)1291Elo90.9
CritPt5.1Accuracy (self-reported)90.5
BenchTable69.3Total Score (%)85
SWE-bench Verified72.8Resolved (%)84.8
WebApp1K Duo75Pass@1 (%)84.4
Kagi LLM Benchmark70.3Accuracy (%)82.1
Hack-Verifiable TextArena23.3Avg HR (self-reported)81.8
Vals AI LiveCodeBench84.72Accuracy (%)79.5
Wolfram LLM Benchmarking Project47.7Correct Functionality (%)66.7

Interactive version: theaggregate.ai/model?slug=gpt-5-codex · How the rankings work · Data refreshed daily, snapshot 2026-07-22.