SALAD-Bench Base — leaderboard

Metric: Safety Score (%). Source: huggingface.co. 34 models tracked.

Top models

#ModelScore
1Claude 299.77
2internlm2-chat-20B98.15
3internlm2-chat-7B97.7
4Llama 2 13B Chat Base96.81
5internlm-20B Chat96.81
6Llama 2 7B Chat96.51
7Llama 2 70B Chat (HF)96.21
8gemma-2B (IT)95.9
9Qwen 1.5 4B Chat95.51
10Qwen 1.5 14B Chat95.37
11Qwen-14B-Chat95.35
12gemma-7B (IT)94.08
13Qwen 1.5 72B Chat93.55
14GPT-4 Turbo93.49
15Qwen 1.5 7B Chat93

Interactive version: theaggregate.ai/benchmark?slug=salad-bench-base · How the rankings work · Data refreshed daily, snapshot 2026-07-22.