O4 Mini Deep Research: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1762 ± 26, rank #100 of 1629 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Mr Dre - Content Feedback Incorporation Rate93.6Incorporation rate (%; turn-2 revision after content feedbac100
Mr Dre - Format Feedback Incorporation Rate98.5Incorporation rate (%; turn-2 revision after format feedback100
DailyReport (Deep Research Agents) - Factuality66.3Factuality (0-1 scaled to %), the share of extracted objecti75
DailyReport (Deep Research Agents) - SubTask Pass24.1Share of subtasks (0-1 scaled to %) that satisfy every rubri75
Mr Dre - Content Feedback Break Rate29.7Break rate (%; share of checklist criteria covered in the tu75
Mr Dre - Format Feedback Break Rate14.8Break rate (%; share of checklist criteria covered in the tu75
MedProbeBench (Deep Research Agents) - Claim Recall44.4Task success rate (x100): share of the expert guideline atom66.7
SnakeBench23.6TrueSkill Rating57.2
DailyReport (Deep Research Agents) - Rationality77.8Rationality (0-1 scaled to %), rubric scores of 0, 0.5 or 1 50
MedProbeBench (Deep Research Agents)56.1Overall score (x100): task-weighted composite of holistic qu50
MedProbeBench (Deep Research Agents) - Evidence Verification50.2Evidence verification (x100): task-weighted composite of cla50
MedProbeBench (Deep Research Agents) - Holistic Quality69.9Holistic quality (x100): task-weighted mean of comprehensive50

Interactive version: theaggregate.ai/model?slug=o4-mini-deep-research · How It Works · Data refreshed daily, snapshot 2026-10-07.