O4 Mini (2025-04-16) (High) — benchmark results

O4 Mini (2025-04-16) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1751 ± 31, rank #197 of 1776 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Defects4J53.8Defects4J Plausible @1 (self-reported)100
RepairBench50.3Plausible@1 (%)100
Arena-Hard v279.1Win Rate (%)96.3
Arena-Hard v2 (GPT-4.1 Judge)81.7Win Rate (%)96.3
MATH Level 597.83Accuracy (%)96.3
EsoBench26.8Score91.9
OpenCompass Research - IFEval93Score (%)87.2
LiveCodeBench Pro2092Rating (CF-style)86.8
UGI - Natural Intelligence38.77NatInt Score86.8
UGI - Writing43.18Writing Score83.3
SEAL - EnigmaEval9.21Score77.2
OpenCompass Research - AIME 202591Score (%)74.5

Interactive version: theaggregate.ai/model?slug=o4-mini-2025-04-16-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.