GPT-5.1 Codex Mini (High): benchmark results
Provider: OpenAI. Released 2025-11-19. Access: API.
Unified ELO 1605 ± 1, rank #437 of 1919 rated models, from 37 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA IFBench | 67.89 | Accuracy (%) | 81.4 |
| AA Terminal-Bench Hard | 33.33 | Accuracy (%) | 77.7 |
| LLM Chess (Saplin) | 544 | ELO | 77 |
| AA Global-MMLU-Lite - Yoruba | 69.92 | Accuracy (%) | 74.8 |
| Artificial Analysis Intelligence Index | 20.38 | Intelligence Index | 71.4 |
| AA Humanity's Last Exam | 18.49 | Accuracy (%) | 69.5 |
| AA GPQA Diamond | 81.31 | Accuracy (%) | 69.4 |
| AA Global-MMLU-Lite - Swahili | 80.08 | Accuracy (%) | 68.9 |
| AA Omniscience - Health | 25.33 | Accuracy (%) | 67 |
| AA Omniscience | -16.42 | Score | 66.5 |
| AA Global-MMLU-Lite | 85.02 | Accuracy (%) | 65.8 |
| AA Global-MMLU-Lite - Arabic | 85.67 | Accuracy (%) | 65.8 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-codex-mini-high · How It Works · Data refreshed daily, snapshot 2026-09-08.