CyberSecEval-3 Prompt Injection: leaderboard
Metric: Prompt injection success (%). Source: arxiv.org. 7 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4 Turbo | 17 |
| 2 | Gemini 1.0 Pro | 18 |
| 3 | Llama 3 8B | 19 |
| 4 | Qwen 2 72B Instruct | 20 |
| 5 | Llama 3.1 405B | 22 |
| 6 | Llama 3 70B | 26 |
| 7 | Mixtral 8x22B | 35 |
Interactive version: theaggregate.ai/benchmark?slug=cyberseceval-3-prompt-injection · How It Works · Data refreshed daily, snapshot 2026-10-09.