SIGNPOST-Bench - Adversarial-Text Localization: leaderboard

Metric: Weighted localization accuracy (%; exp(-0.005 x geodesic km), four-dataset macro average). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)44.41
2Gemini 3 Flash43.8
3Gemini 2.5 Pro40.18
4Doubao-Seed-2.0-Pro-26021538.95
5GPT-536.95
6Gemini 2.5 Flash36.9
7Kimi K2.535.29
8Claude Sonnet 4.634.66
9Claude Opus 4.634.47
10Qwen 3 VL 30B A3B Instruct29.03
11GPT-4o28.07
12GPT-5.425.9
13Qwen 3 VL 235B A22B Instruct25.49
14GPT-4o Mini20.35
15Grok 417.89

Interactive version: theaggregate.ai/benchmark?slug=signpost-bench-adversarial-text-localization · How It Works · Data refreshed daily, snapshot 2026-09-19.