GPT-5.1 Codex Max: benchmark results

OpenAI's higher-compute GPT-5.1 Codex variant for coding and software-agent tasks. Provider: OpenAI. Released 2025-11-19. Access: API.

Unified ELO 1676 ± 1, rank #88 of 1392 rated models, from 36 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MERA Code0.54Total score100
MERA Code - stRuCom38.3chrF (%)100
SnakeBench36.4TrueSkill Rating98.6
MERA Code - CodeCorrectness91.33Accuracy (%)98.5
MERA Code - JavaTestGen55.95pass@1 (%)98.5
MERA Code - RealCode48.5pass@1 (%)98.5
MERA Code - UnitTests32.31CodeBLEU (%)96.9
MERA Code - CodeLinterEval95.55pass@1 (%)95.4
MERA Code - ruCodeReviewer12.34Top-1 Accuracy (%)93.8
AI Chess Leaderboard (Continuation)1354Elo92
AI Chess Leaderboard (Reasoning)1354Elo89.5
LM Market Cap LMC Score88.7LMC Score (0-100)88.5

Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex-max · How It Works · Data refreshed daily, snapshot 2026-09-05.