SALAD-Bench Attack — leaderboard

Metric: Safety Score (%). Source: huggingface.co. 34 models tracked.

Top models

#ModelScore
1Claude 288.06
2GPT-4 Turbo80.28
3GPT-3.5 Turbo73.4
4Llama 2 70B Chat (HF)66.24
5Llama 2 13B Chat Base65.72
6gemma-2B (IT)50.34
7internlm-20B Chat29.82
8Yi 34B (Chat)23.64
9Qwen 1.5 4B Chat23.34
10Yi 6B (Chat)22.56
11internlm2-chat-7B20.28
12Gemini 1.0 Pro20.04
13Llama 2 7B Chat18.24
14Qwen 1.5 72B Chat16.22
15gemma-7B (IT)15.54

Interactive version: theaggregate.ai/benchmark?slug=salad-bench-attack · How the rankings work · Data refreshed daily, snapshot 2026-07-22.