CyberSecEval — leaderboard

CyberSecEval: Measures model robustness, truthfulness, calibration, bias, harmfulness, jailbreak resistance, or alignment-relevant behavior.

Metric: Average Injection Success Rate (self-reported). Source: benchmarklist.com. 7 models tracked.

Top models

#ModelScore
1Llama 3 8B Instruct45.27
2GPT-3.5 Turbo39.13
3CodeLlama-34B-Instruct36.33
4Llama 3 70B Instruct29.27
5GPT-419.87

Interactive version: theaggregate.ai/benchmark?slug=cyberseceval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.