DeepResearchEval - Factual Accuracy: leaderboard

Metric: Verified-correct share (%; checkable statements a GPT-5-mini web-search agent judges right, of all checkable statements; wrong or unverifiable count against). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 9 models tracked.

Top models

#ModelScore
1Manus82.3
2Gemini-2.5-Pro Deep Research76.62
3DeepSeek Deep Research76.44
4OpenAI Deep Research76.21
5Qwen-3-235B-A22B Deep Research72.39
6Doubao Deep Research69.5
7Grok4 Deep Research61.81
8DeepResearchEval Claude-Sonnet-4.5 Deep Research (checkpoint unspecified)60.72
9Perplexity Deep Research58.94

Interactive version: theaggregate.ai/benchmark?slug=deepresearcheval-factual-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-26.