SIGNPOST-Bench - Similar-Text Localization: leaderboard

Metric: Weighted localization accuracy (%; exp(-0.005 x geodesic km), four-dataset macro average). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)57.15
2Gemini 3 Flash56.62
3Doubao-Seed-2.0-Pro-26021554.69
4Gemini 2.5 Pro53.93
5GPT-552.55
6Kimi K2.551.61
7Gemini 2.5 Flash50.15
8Claude Sonnet 4.648.88
9Claude Opus 4.647.66
10GPT-4o43.2
11Qwen 3 VL 235B A22B Instruct41.11
12GPT-5.439.47
13Qwen 3 VL 30B A3B Instruct38.52
14Grok 437.24
15GPT-4o Mini35.12

Interactive version: theaggregate.ai/benchmark?slug=signpost-bench-similar-text-localization · How It Works · Data refreshed daily, snapshot 2026-09-19.