SIGNPOST-Bench - Conflict Robustness Score: leaderboard

Metric: R (%; retention under random and adversarial text with error and trap penalties). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Gemini 3 Flash85.93
2Gemini 2.5 Pro85.1
3Gemini 3.1 Pro (Preview)84.49
4Qwen 3 VL 30B A3B Instruct80.05
5Gemini 2.5 Flash77.77
6Claude Opus 4.676.84
7GPT-575.3
8Claude Sonnet 4.674.3
9GPT-5.472.27
10Doubao-Seed-2.0-Pro-26021571.21
11Kimi K2.570.57
12GPT-4o69.74
13GPT-4o Mini69.02
14Qwen 3 VL 235B A22B Instruct66.16
15Grok 453.82

Interactive version: theaggregate.ai/benchmark?slug=signpost-bench-conflict-robustness-score · How It Works · Data refreshed daily, snapshot 2026-09-19.