DeepResearchEval - Factual Accuracy: leaderboard
Metric: Verified-correct share (%; checkable statements a GPT-5-mini web-search agent judges right, of all checkable statements; wrong or unverifiable count against). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 9 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Manus | 82.3 |
| 2 | Gemini-2.5-Pro Deep Research | 76.62 |
| 3 | DeepSeek Deep Research | 76.44 |
| 4 | OpenAI Deep Research | 76.21 |
| 5 | Qwen-3-235B-A22B Deep Research | 72.39 |
| 6 | Doubao Deep Research | 69.5 |
| 7 | Grok4 Deep Research | 61.81 |
| 8 | DeepResearchEval Claude-Sonnet-4.5 Deep Research (checkpoint unspecified) | 60.72 |
| 9 | Perplexity Deep Research | 58.94 |
Interactive version: theaggregate.ai/benchmark?slug=deepresearcheval-factual-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-26.