DeepSearchQA: leaderboard

Deep-search question-answering benchmark for agents that must gather, compare, and synthesize evidence across multi-hop web research tasks.

Metric: Score (%). Source: llm-stats.com. Status: years away from saturation. 10 models tracked.

Top models

#ModelScore
1Kimi K395
2Claude Opus 4.893.1
3Claude Opus 4.691.3
4Hy391
5Muse Spark 1.389.4
6MiMo-V2-Pro86.7
7Kimi K2.683
8Kimi K2.577.1
9Muse Spark74.8
10Muse Glimmer 30B74.6

Interactive version: theaggregate.ai/benchmark?slug=deepsearchqa · How It Works · Data refreshed daily, snapshot 2026-09-05.