Ko-WideSearch - Table Success: leaderboard

Metric: Table Success (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5.519.3
2Claude Opus 4.816.2
3Claude Opus 4.715.8
4Claude Opus 4.614.9
5Gemini 3.1 Pro (Preview)14.5
6Gemini 3.5 Flash12.7
7DeepSeek V4 Pro12.3
8GLM-5.112.3
9Claude Sonnet 4.611.8
10GPT-5.410.5
11Claude Haiku 4.57
12Gemini 3.1 Flash Lite7
13GPT-5.4 Mini5.7
14GPT-5.4 Nano5.7
15A.X 4.04.4

Interactive version: theaggregate.ai/benchmark?slug=ko-widesearch-table-success · How It Works · Data refreshed daily, snapshot 2026-09-19.