Doubao Deep Research: benchmark results
Provider: ByteDance. Access: Open.
Unified ELO 1707 ± 19, rank #175 of 1636 rated models, from 19 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| DeepResearch Bench - Effective Citations | 52.62 | Effective Citations | 91.7 |
| DeepResearch Bench II - Analysis | 49.43 | Rubric pass rate (%; analysis rubrics; 132 report tasks in 2 | 71.4 |
| Wiki Live Challenge - Wikipedia Fact Coverage | 22.97 | Fact coverage (%; mean consistency score of the Wikipedia ar | 60 |
| DeepResearch Bench II | 40.99 | Rubric pass rate (%; 132 report tasks in 22 domains; share o | 57.1 |
| DeepResearch Bench II - Information Recall | 34.83 | Rubric pass rate (%; information-recall rubrics; 132 report | 57.1 |
| DeepResearchEval | 7.06 | Report quality (0-10; per-task weighted general and task-spe | 50 |
| DeepResearch Bench - Citation Accuracy | 52.86 | Score (%) | 41.7 |
| MiroEval (Text-Only) - Synthesis | 64.2 | Synthesis quality (0-100): task-specific weighted rubric ove | 41.7 |
| DeepResearchEval - Factual Accuracy | 69.5 | Verified-correct share (%; checkable statements a GPT-5-mini | 37.5 |
| DeepResearch Bench - Comprehensiveness | 44.84 | Score (%) | 29.5 |
| DeepResearch Bench - Instruction Following | 47.95 | Score (%) | 29.5 |
| DeepResearch Bench - Readability | 44.69 | Score (%) | 29.5 |
Interactive version: theaggregate.ai/model?slug=doubao-deep-research · How It Works · Data refreshed daily, snapshot 2026-10-11.