GPT-5 Codex (High): benchmark results
GPT-5 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-09-23. Access: API.
Unified ELO 1653 ± 1, rank #233 of 1761 rated models, from 46 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| WebCoderBench - Visual Experience | 93.83 | Score (%) | 100 |
| AA AIME 2025 | 98.67 | Accuracy (%) | 99.4 |
| AA Omniscience - Software Engineering (SWE) - Java | 42 | Accuracy (%) | 97.6 |
| AA Omniscience - Software Engineering (SWE) - Dart | 42 | Accuracy (%) | 96.4 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 55.45 | Accuracy (%) | 96.1 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 46 | Accuracy (%) | 96.1 |
| AA Omniscience - Software Engineering (SWE) - Swift | 64 | Accuracy (%) | 96.1 |
| AA Omniscience - Software Engineering (SWE) - PHP | 54 | Accuracy (%) | 95.7 |
| AA LiveCodeBench | 84.02 | Pass@1 (%) | 95.6 |
| AA MMLU-Pro | 86.49 | Accuracy (%) | 95 |
| AA Omniscience - Software Engineering (SWE) - R | 38 | Accuracy (%) | 93.7 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 48.89 | Accuracy (%) | 93.3 |
Interactive version: theaggregate.ai/model?slug=gpt-5-codex-high · How It Works · Data refreshed daily, snapshot 2026-09-05.