FutureSearch DRB - Validate Claim — leaderboard

Metric: Average Score. Source: evals.futuresearch.ai. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.60.8
2Claude Opus 4.60.8
3GPT-50.78
4Claude Opus 4.50.76
5GPT-5.50.76
6Claude Opus 4.80.76
7O30.72
8GPT-5.4 Mini0.71
9GPT-5.10.71
10Claude Opus 4.10.69
11Claude Sonnet 4.50.68
12Claude Sonnet 40.68
13Gemini 3.1 Pro (Preview)0.67
14Gemini 3 Pro0.66
15Grok 40.65

Interactive version: theaggregate.ai/benchmark?slug=futuresearch-drb-validate-claim · How the rankings work · Data refreshed daily, snapshot 2026-07-22.