GPT-5.1 Codex (High): benchmark results
GPT-5.1 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-11-19. Access: API.
Unified ELO 1646 ± 1, rank #256 of 1761 rated models, from 41 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Global-MMLU-Lite - French | 92.75 | Accuracy (%) | 93.7 |
| AA Global-MMLU-Lite - Hindi | 90.58 | Accuracy (%) | 93.7 |
| AA Global-MMLU-Lite - Swahili | 89.5 | Accuracy (%) | 93.2 |
| AA Global-MMLU-Lite - Japanese | 91.08 | Accuracy (%) | 91.9 |
| AA Global-MMLU-Lite - Spanish | 92.75 | Accuracy (%) | 90.1 |
| AA Global-MMLU-Lite - Bengali | 89.92 | Accuracy (%) | 89.2 |
| AA Global-MMLU-Lite - Yoruba | 79.75 | Accuracy (%) | 89.2 |
| ALE-Bench | 1244.92 | Performance (Self-Refine x1) (self-reported) | 88.6 |
| AA Global-MMLU-Lite | 89.7 | Accuracy (%) | 87.4 |
| AA Global-MMLU-Lite - Chinese | 90.92 | Accuracy (%) | 87.4 |
| AA Omniscience - Health | 39.7 | Accuracy (%) | 87.1 |
| AA Global-MMLU-Lite - Italian | 91.92 | Accuracy (%) | 86.5 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex-high · How It Works · Data refreshed daily, snapshot 2026-09-05.