DeepResearchEval: leaderboard

Metric: Report quality (0-10; per-task weighted general and task-specific dimensions scored by Gemini-2.5-Pro, mean over 100 tasks). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 9 models tracked.

Top models

#ModelScore
1Gemini-2.5-Pro Deep Research8.51
2DeepResearchEval Claude-Sonnet-4.5 Deep Research (checkpoint unspecified)7.53
3OpenAI Deep Research7.28
4Qwen-3-235B-A22B Deep Research7.17
5Doubao Deep Research7.06
6Grok4 Deep Research6.92
7Perplexity Deep Research6.86
8Manus5.95
9DeepSeek Deep Research5.25

Interactive version: theaggregate.ai/benchmark?slug=deepresearcheval · How It Works · Data refreshed daily, snapshot 2026-09-26.