FutureSearch DRB - Populate Reference Class — leaderboard

Metric: Average Score. Source: evals.futuresearch.ai. 22 models tracked.

Top models

#ModelScore
1Claude Opus 4.60.4
2GPT-5.50.4
3Gemini 3.1 Pro (Preview)0.38
4Claude Sonnet 4.60.37
5Gemini 3 Flash0.37
6Gemini 3 Pro0.36
7Claude Opus 4.50.36
8Grok 40.35
9O30.35
10Claude Opus 4.80.35
11Claude Sonnet 4.50.34
12GPT-50.34
13Claude Opus 40.33
14Claude Opus 4.10.32
15Claude Sonnet 40.31

Interactive version: theaggregate.ai/benchmark?slug=futuresearch-drb-populate-reference-class · How the rankings work · Data refreshed daily, snapshot 2026-07-22.