OI-Bench - Instructional Interference - Injected Accuracy: leaderboard

Metric: Accuracy (%). Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1GPT-588.43
2Claude Haiku 4.585.68
3Llama 4 Maverick79.12
4Gemini 2.5 Pro77.9
5Grok 4.176.71
6Llama 4 Scout76.05
7Qwen 3 235B A22B73.99
8GPT-5 Mini73.75
9DeepSeek R170.12
10DeepSeek V3.268.7
11Gemini 2.5 Flash Lite64.05
12Qwen 3 8B63.93

Interactive version: theaggregate.ai/benchmark?slug=oi-bench-instructional-interference-injected-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-25.