Ko-WideSearch - Row F1: leaderboard

Metric: F1 (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5.553.7
2Claude Opus 4.852.9
3Claude Opus 4.751.6
4Claude Opus 4.648.9
5Gemini 3.1 Pro (Preview)45.9
6Gemini 3.1 Flash Lite45.9
7DeepSeek V4 Pro45
8Gemini 3.5 Flash44.1
9Claude Sonnet 4.643.6
10GPT-5.441.6
11GLM-5.134
12GPT-5.4 Mini33.3
13Claude Haiku 4.528.8
14A.X 4.024.2
15Gemma 4 31B23

Interactive version: theaggregate.ai/benchmark?slug=ko-widesearch-row-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.