GPT-5.1 Codex (High): benchmark results

GPT-5.1 Codex evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-11-19. Access: API.

Unified ELO 1646 ± 1, rank #256 of 1761 rated models, from 41 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Global-MMLU-Lite - French92.75Accuracy (%)93.7
AA Global-MMLU-Lite - Hindi90.58Accuracy (%)93.7
AA Global-MMLU-Lite - Swahili89.5Accuracy (%)93.2
AA Global-MMLU-Lite - Japanese91.08Accuracy (%)91.9
AA Global-MMLU-Lite - Spanish92.75Accuracy (%)90.1
AA Global-MMLU-Lite - Bengali89.92Accuracy (%)89.2
AA Global-MMLU-Lite - Yoruba79.75Accuracy (%)89.2
ALE-Bench1244.92Performance (Self-Refine x1) (self-reported)88.6
AA Global-MMLU-Lite89.7Accuracy (%)87.4
AA Global-MMLU-Lite - Chinese90.92Accuracy (%)87.4
AA Omniscience - Health39.7Accuracy (%)87.1
AA Global-MMLU-Lite - Italian91.92Accuracy (%)86.5

Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex-high · How It Works · Data refreshed daily, snapshot 2026-09-05.