GPT-5.1 Codex Max: benchmark results
OpenAI's higher-compute GPT-5.1 Codex variant for coding and software-agent tasks. Provider: OpenAI. Released 2025-11-19. Access: API.
Unified ELO 1676 ± 1, rank #88 of 1392 rated models, from 36 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MERA Code | 0.54 | Total score | 100 |
| MERA Code - stRuCom | 38.3 | chrF (%) | 100 |
| SnakeBench | 36.4 | TrueSkill Rating | 98.6 |
| MERA Code - CodeCorrectness | 91.33 | Accuracy (%) | 98.5 |
| MERA Code - JavaTestGen | 55.95 | pass@1 (%) | 98.5 |
| MERA Code - RealCode | 48.5 | pass@1 (%) | 98.5 |
| MERA Code - UnitTests | 32.31 | CodeBLEU (%) | 96.9 |
| MERA Code - CodeLinterEval | 95.55 | pass@1 (%) | 95.4 |
| MERA Code - ruCodeReviewer | 12.34 | Top-1 Accuracy (%) | 93.8 |
| AI Chess Leaderboard (Continuation) | 1354 | Elo | 92 |
| AI Chess Leaderboard (Reasoning) | 1354 | Elo | 89.5 |
| LM Market Cap LMC Score | 88.7 | LMC Score (0-100) | 88.5 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex-max · How It Works · Data refreshed daily, snapshot 2026-09-05.