CIBER (OpenInterpreter) - Prompt-Based Backdoor: leaderboard

Metric: Attack success rate (%) of prompt-based backdoor attacks against the OpenInterpreter code-interpreter agent, natural-language inputs over CIBER's 25 RedCode-derived risk scenarios (750 tests per cell), success verified by state probes in a Docker sandbox; lower is better. Source: arxiv.org. 3 models tracked.

Top models

#ModelScoreOverall rank
1OpenInterpreter + GPT-5-mini13.7
2OpenInterpreter + GPT-3.5-Turbo28.5
3OpenInterpreter + GPT-4o59.3

Interactive version: theaggregate.ai/benchmark?slug=ciber-openinterpreter-prompt-based-backdoor · How It Works · Data refreshed daily, snapshot 2026-10-11.