FutureSearch DRB - Gather Evidence — leaderboard

Metric: Average Score. Source: evals.futuresearch.ai. 22 models tracked.

Top models

#ModelScore
1Claude Opus 40.4
2GPT-50.38
3O30.38
4Gemini 3 Pro0.36
5Claude Opus 4.10.36
6Claude Sonnet 40.34
7Grok 40.34
8Claude Sonnet 4.60.33
9GPT-5.10.33
10Claude Opus 4.50.32
11Claude Opus 4.60.32
12Gemini 3 Flash0.3
13Claude Haiku 4.50.29
14Gemini 2.5 Pro0.28
15Claude Sonnet 4.50.28

Interactive version: theaggregate.ai/benchmark?slug=futuresearch-drb-gather-evidence · How the rankings work · Data refreshed daily, snapshot 2026-07-22.