O4 Mini (2025-04-16) (High) — benchmark results
O4 Mini (2025-04-16) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.
Unified ELO 1751 ± 31, rank #197 of 1776 rated models, from 34 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Defects4J | 53.8 | Defects4J Plausible @1 (self-reported) | 100 |
| RepairBench | 50.3 | Plausible@1 (%) | 100 |
| Arena-Hard v2 | 79.1 | Win Rate (%) | 96.3 |
| Arena-Hard v2 (GPT-4.1 Judge) | 81.7 | Win Rate (%) | 96.3 |
| MATH Level 5 | 97.83 | Accuracy (%) | 96.3 |
| EsoBench | 26.8 | Score | 91.9 |
| OpenCompass Research - IFEval | 93 | Score (%) | 87.2 |
| LiveCodeBench Pro | 2092 | Rating (CF-style) | 86.8 |
| UGI - Natural Intelligence | 38.77 | NatInt Score | 86.8 |
| UGI - Writing | 43.18 | Writing Score | 83.3 |
| SEAL - EnigmaEval | 9.21 | Score | 77.2 |
| OpenCompass Research - AIME 2025 | 91 | Score (%) | 74.5 |
Interactive version: theaggregate.ai/model?slug=o4-mini-2025-04-16-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.