SGI-Bench Deep Research — leaderboard

Metric: Deep Research Score. Source: github.com. 19 models tracked.

Top models

#ModelScore
1Gemini 3 Pro18.48
2Intern-S115.74
3GPT-5.2 Pro15.72
4Qwen 3 Max15.38
5Gemini 2.5 Pro15.09
6GPT-514.47
7Claude Sonnet 4.513.84
8Grok 413.31
9Claude Opus 4.112.93
10O312.89
11Qwen 3 VL 235B A22B11.97
12O4 Mini11.95
13GPT-5.111.64
14GPT-4.111.32
15Gemini 2.5 Flash10.69

Interactive version: theaggregate.ai/benchmark?slug=sgi-bench-deep-research · How the rankings work · Data refreshed daily, snapshot 2026-07-22.