K-BrowseComp: leaderboard

Metric: Pass@1 accuracy (%) on the 300-question K-BrowseComp-Verified subset; search_evals deep-research agent with Perplexity Search, 10 search calls per question, one run, GPT-5.4-mini answer extraction against the gold answer. Source: arxiv.org. Saturation forecast: Around January 2027. 11 models tracked.

Top models

#ModelScore
1GLM-5.130.67
2GPT-5.4 Mini30.67
3DeepSeek V4 Pro30
4Gemma 4 31B (IT)23.33
5Qwen 3.6 35B A3B12
6Gemini 3.1 Flash Lite11.33
7K-EXAONE10.33
8A.X 4.05.33
9HyperCLOVA X SEED Think (32B)2.33

Interactive version: theaggregate.ai/benchmark?slug=k-browsecomp · How It Works · Data refreshed daily, snapshot 2026-09-29.