GPT-5.1 Codex — benchmark results

OpenAI's Codex-specialized GPT-5.1 model for coding and software-agent workloads. Provider: OpenAI. Released 2025-11-19. Access: API.

Unified ELO 1755 ± 37, rank #188 of 1776 rated models, from 39 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
PrepBench54.9End-to-End Prep-Code Acc. (self-reported)100
SWE-Lancer66.3Score (%)100
AI Chess Leaderboard (Reasoning)1743Elo98
AI Chess Leaderboard (Continuation)1418Elo95.1
CritPt5.7Accuracy (self-reported)91
SnakeBench32.1TrueSkill Rating90.9
AA-LCR67.3Score (self-reported)90.2
Vals AI LiveCodeBench85.55Accuracy (%)84.3
MonitoringBench71.1Baseline catch rate (%) (self-reported)83.3
BenchTable66.8Total Score (%)81.4
WebApp1K Duo74.3Pass@1 (%)79.2
Terminal-Bench 2.057.8Accuracy (%)70.7

Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex · How the rankings work · Data refreshed daily, snapshot 2026-07-22.