GPT-5.1 Codex (High) — benchmark results
GPT-5.1 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-11-19. Access: API.
Unified ELO 1830 ± 27, rank #114 of 1776 rated models, from 59 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA AIME 2025 | 95.67 | Accuracy (%) | 97.2 |
| AA LiveCodeBench | 84.87 | Pass@1 (%) | 95.9 |
| AA MMLU-Pro | 86.01 | Accuracy (%) | 94.5 |
| AA Global-MMLU-Lite - French | 92.75 | Accuracy (%) | 94 |
| AA Global-MMLU-Lite - Hindi | 90.58 | Accuracy (%) | 94 |
| AA Global-MMLU-Lite - Swahili | 89.5 | Accuracy (%) | 93.2 |
| AA Global-MMLU-Lite - Japanese | 91.08 | Accuracy (%) | 92.2 |
| AA Omniscience - Health | 39 | Accuracy (%) | 92.2 |
| AA Omniscience - Software Engineering (SWE) - Swift | 72 | Accuracy (%) | 91.7 |
| AA Global-MMLU-Lite - Spanish | 92.75 | Accuracy (%) | 90.6 |
| AA Global-MMLU-Lite - Bengali | 89.92 | Accuracy (%) | 89.8 |
| ALE-Bench | 1244.92 | Performance (Self-Refine x1) (self-reported) | 89.7 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.