OI-Bench - Social Compliance - Injected Accuracy: leaderboard

Metric: Accuracy (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1GPT-588.66
2Claude Haiku 4.586.79
3Qwen 3 235B A22B84.4
4Gemini 2.5 Pro82.5
5Llama 4 Maverick80.36
6Grok 4.178.33
7Llama 4 Scout77.57
8DeepSeek V3.276.75
9DeepSeek R176.58
10GPT-5 Mini76.12
11Gemini 2.5 Flash Lite68.89
12Qwen 3 8B65.4

Interactive version: theaggregate.ai/benchmark?slug=oi-bench-social-compliance-injected-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-25.