O3 Deep Research: benchmark results
Provider: OpenAI. Access: API.
Unified ELO 1830 ± 23, rank #50 of 1607 rated models, from 20 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| DEEPSYNTH | 8.97 | F1 (self-reported) | 100 |
| DeepResearch Bench II | 45.4 | Rubric pass rate (%; 132 report tasks in 22 domains; share o | 100 |
| DeepResearch Bench II - Information Recall | 39.98 | Rubric pass rate (%; information-recall rubrics; 132 report | 100 |
| Expert Consulting Deep Research | 61.4 | Strict Verifier-Rubric Score (0-100): 0.5 x verifier pass ra | 100 |
| Expert Consulting Deep Research - SME Rubric | 1.89 | Mean SME rubric score (0-3; data integrity, analytical rigor | 100 |
| Expert Consulting Deep Research - Verifier Pass Rate | 60.2 | Mean share of task-specific deterministic binary verifiers p | 100 |
| DeepResearch Bench II - Analysis | 49.85 | Rubric pass rate (%; analysis rubrics; 132 report tasks in 2 | 85.7 |
| SnakeBench | 29.7 | TrueSkill Rating | 84.7 |
| DailyReport (Deep Research Agents) | 2.42 | User preference score (1-4: unhelpful, deficient, acceptable | 75 |
| DailyReport (Deep Research Agents) - Rationality | 85.6 | Rationality (0-1 scaled to %), rubric scores of 0, 0.5 or 1 | 75 |
| SciHazard (Deep Research Agents) - Oversafety | 0 | Over-refusal rate (%; share of 600 benign defence, detection | 75 |
| Wiki Live Challenge | 31.08 | Wiki Writing win rate (%; share of 39 Good Article criteria | 70 |
Interactive version: theaggregate.ai/model?slug=o3-deep-research · How It Works · Data refreshed daily, snapshot 2026-09-29.