SearchAgent Leaderboard — leaderboard
Standardized leaderboard for search-augmented question-answering agents across general QA, multi-hop QA, and the closed-world FictionalHot benchmark.
Metric: Average Exact Match (%). Source: huggingface.co. 12 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | ReSeek-Qwen2.5-7b-Instruct | 37.74 |
| 2 | ZeroSearch-Qwen2.5-7b-Instruct | 34.59 |
| 3 | Search-R1-Qwen2.5-7b-Instruct | 34.15 |
| 4 | ReSeek-Qwen2.5-3b-Instruct | 31.18 |
| 5 | Search-R1-Qwen2.5-3b-Instruct | 28.89 |
| 6 | ZeroSearch-Qwen2.5-3b-Instruct | 28.11 |
| 7 | RAG-Qwen2.5-7b-Instruct | 26.73 |
| 8 | R1-Qwen2.5-7b-Instruct | 23.79 |
| 9 | Search-o1-Qwen2.5-7b-Instruct | 18.27 |
| 10 | SFT-Qwen2.5-7b-Instruct | 18.12 |
Interactive version: theaggregate.ai/benchmark?slug=searchagent-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.