FutureSearch DRB - Compile Dataset — leaderboard

Metric: Average Score. Source: evals.futuresearch.ai. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.60.75
2GPT-5.50.74
3Claude Opus 4.60.72
4Claude Opus 4.80.7
5Gemini 3.1 Pro (Preview)0.7
6Claude Opus 4.50.7
7GPT-50.67
8Gemini 3 Pro0.62
9Gemini 3 Flash0.59
10O30.56
11Claude Sonnet 4.50.56
12Claude Sonnet 40.52
13Gemini 3.1 Flash Lite (Preview)0.52
14Claude Haiku 4.50.51
15Claude Opus 40.5

Interactive version: theaggregate.ai/benchmark?slug=futuresearch-drb-compile-dataset · How the rankings work · Data refreshed daily, snapshot 2026-07-22.