SIGNPOST-Bench - Random-Text Localization: leaderboard

Metric: Weighted localization accuracy (%; exp(-0.005 x geodesic km), four-dataset macro average). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)45.41
2Gemini 3 Flash45.21
3Doubao-Seed-2.0-Pro-26021542.69
4Gemini 2.5 Pro41.6
5GPT-537.56
6Gemini 2.5 Flash36.65
7Claude Opus 4.635.2
8Claude Sonnet 4.634.81
9Kimi K2.534.59
10Qwen 3 VL 30B A3B Instruct29.57
11GPT-4o27.85
12Qwen 3 VL 235B A22B Instruct26.61
13GPT-5.425.32
14GPT-4o Mini23.57
15Grok 417.58

Interactive version: theaggregate.ai/benchmark?slug=signpost-bench-random-text-localization · How It Works · Data refreshed daily, snapshot 2026-09-19.