O4 Mini (2025-04-16) (High): benchmark results

O4 Mini (2025-04-16) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1621 ± 1, rank #352 of 1761 rated models, from 52 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Defects4J53.8Defects4J Plausible @1 (self-reported)100
RepairBench50.3Plausible@1 (%)100
Arena-Hard v279.1Win Rate (%)96.3
Arena-Hard v2 (GPT-4.1 Judge)81.7Win Rate (%)96.3
MATH Level 597.83Accuracy (%)96.3
EsoBench26.8Score91.9
Vals AI MedQA96.02Accuracy (%)91.5
Vals AI MGSM93.42Accuracy (%)88.6
OpenCompass Research - IFEval93Score (%)87.2
LiveCodeBench Pro2092Rating (CF-style)86.8
UGI - Natural Intelligence38.77NatInt Score86.1
Vals AI MATH 50094.2Accuracy (%)84.5

Interactive version: theaggregate.ai/model?slug=o4-mini-2025-04-16-high · How It Works · Data refreshed daily, snapshot 2026-09-05.