CyberSecEval2 Interpreter Abuse — leaderboard

Metric: Accuracy (%). Source: github.com. 10 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash (001)33.5
2Claude 3.7 Sonnet (20250219)28.35
3DeepSeek V3 Chat28.1
4Llama 3.3 70B Instruct24.6
5mistral-large-latest23.9
6Grok 2 (1212)20
7Llama 3.2 90B Vision Instruct19.05
8mistral-small-latest18.55
9GPT-4o Mini (2024-07-18)3
10GPT-4o (2024-08-06)2.55

Interactive version: theaggregate.ai/benchmark?slug=cyberseceval2-interpreter-abuse · How the rankings work · Data refreshed daily, snapshot 2026-07-22.