OI-Bench - Instructional Interference - Attack Success Rate: leaderboard

Metric: Attack Success Rate (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1GPT-53.44
2Claude Haiku 4.56.2
3Llama 4 Maverick6.3
4Llama 4 Scout7.55
5Grok 4.18.55
6GPT-5 Mini9.35
7Gemini 2.5 Pro13.33
8Qwen 3 8B18.19
9Qwen 3 235B A22B18.82
10DeepSeek V3.222.13
11Gemini 2.5 Flash Lite24.07
12DeepSeek R124.88

Interactive version: theaggregate.ai/benchmark?slug=oi-bench-instructional-interference-attack-success-rate · How It Works · Data refreshed daily, snapshot 2026-09-25.