O4 Mini: benchmark results

OpenAI's efficient o4-series reasoning model for fast math, coding, and visual tasks. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1613 ± 1, rank #224 of 1392 rated models, from 216 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MME-Reasoning57.2Overall Accuracy (%)100
ZEROBench-Sub29.05Score (self-reported)97.5
MMMU Benchmark81.6Validation Score96.8
SnakeBench33.9TrueSkill Rating96.8
TRLawBench84.4Stage 1 accuracy (self-reported)96.8
TableBench60.75DP Score (%)96.8
LLM Stats (AIME 2024)93.4Score (%)96.2
VisualPuzzles57Overall Accuracy (%)94.6
OJBench33.3Score (self-reported)94.1
RAI-Bench - RAG Robustness (HY Factuality)47Rate (%)92.8
LLM Stats (MathVista)84.3Score (%)91.9
MedGUIDE58.9Weighted Accuracy (self-reported)91.7

Interactive version: theaggregate.ai/model?slug=o4-mini · How It Works · Data refreshed daily, snapshot 2026-09-05.