O3 Deep Research: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1830 ± 23, rank #50 of 1607 rated models, from 20 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
DEEPSYNTH8.97F1 (self-reported)100
DeepResearch Bench II45.4Rubric pass rate (%; 132 report tasks in 22 domains; share o100
DeepResearch Bench II - Information Recall39.98Rubric pass rate (%; information-recall rubrics; 132 report 100
Expert Consulting Deep Research61.4Strict Verifier-Rubric Score (0-100): 0.5 x verifier pass ra100
Expert Consulting Deep Research - SME Rubric1.89Mean SME rubric score (0-3; data integrity, analytical rigor100
Expert Consulting Deep Research - Verifier Pass Rate60.2Mean share of task-specific deterministic binary verifiers p100
DeepResearch Bench II - Analysis49.85Rubric pass rate (%; analysis rubrics; 132 report tasks in 285.7
SnakeBench29.7TrueSkill Rating84.7
DailyReport (Deep Research Agents)2.42User preference score (1-4: unhelpful, deficient, acceptable75
DailyReport (Deep Research Agents) - Rationality85.6Rationality (0-1 scaled to %), rubric scores of 0, 0.5 or 1 75
SciHazard (Deep Research Agents) - Oversafety0Over-refusal rate (%; share of 600 benign defence, detection75
Wiki Live Challenge31.08Wiki Writing win rate (%; share of 39 Good Article criteria 70

Interactive version: theaggregate.ai/model?slug=o3-deep-research · How It Works · Data refreshed daily, snapshot 2026-09-29.