DeepResearchEval: leaderboard
Metric: Report quality (0-10; per-task weighted general and task-specific dimensions scored by Gemini-2.5-Pro, mean over 100 tasks). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 9 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini-2.5-Pro Deep Research | 8.51 |
| 2 | DeepResearchEval Claude-Sonnet-4.5 Deep Research (checkpoint unspecified) | 7.53 |
| 3 | OpenAI Deep Research | 7.28 |
| 4 | Qwen-3-235B-A22B Deep Research | 7.17 |
| 5 | Doubao Deep Research | 7.06 |
| 6 | Grok4 Deep Research | 6.92 |
| 7 | Perplexity Deep Research | 6.86 |
| 8 | Manus | 5.95 |
| 9 | DeepSeek Deep Research | 5.25 |
Interactive version: theaggregate.ai/benchmark?slug=deepresearcheval · How It Works · Data refreshed daily, snapshot 2026-09-26.