Ko-WideSearch - Item F1: leaderboard

Metric: F1 (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Claude Opus 4.794.6
2Claude Opus 4.894.1
3GPT-5.592.8
4Claude Opus 4.692
5Claude Sonnet 4.690.2
6GPT-5.489
7Gemini 3.1 Flash Lite89
8Gemini 3.1 Pro (Preview)88.2
9GPT-5.4 Mini82.3
10DeepSeek V4 Pro80.4
11Gemini 3.5 Flash79.9
12Gemma 4 31B76.4
13A.X 4.071.7
14Claude Haiku 4.566.7
15GPT-5.4 Nano66.6

Interactive version: theaggregate.ai/benchmark?slug=ko-widesearch-item-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.