Kaggle DeepSearchQA (Google) — leaderboard

Google DeepMind benchmark for deep research agents on 900 multi-step web information-seeking tasks requiring exhaustive answer sets, entity resolution, and stopping-criteria judgment.

Metric: F1 Score (%). Source: www.kaggle.com. Status: saturation imminent. 13 models tracked.

Top models

#ModelScore
1GPT-5 Pro78.98
2GPT-5.478.63
3Gemini 3.1 Pro (Preview)75.77
4GPT-573.24
5Claude Sonnet 4.656.52
6Gemini 2.5 Pro48
7Gemini 2.5 Flash42.99
8Claude Opus 4.5 (Thinking)40.2
9Claude Sonnet 4.5 (Thinking)27.85
10Claude Haiku 4.5 (Thinking)22.24

Interactive version: theaggregate.ai/benchmark?slug=kaggle-deepsearchqa-google · How the rankings work · Data refreshed daily, snapshot 2026-07-22.