SALAD-Bench Base: leaderboard

Metric: Safety Score (%). Source: huggingface.co. 34 models tracked.

Top models

#ModelScore
1Claude 299.77
2internlm2-chat-20B98.15
3internlm2-chat-7B97.7
4Llama 2 13B Chat Base96.81
5Llama 2 7B Chat96.51
6Llama 2 70B Chat (HF)96.21
7gemma-2B (IT)95.9
8Qwen 1.5 4B Chat95.51
9Qwen 1.5 14B Chat95.37
10Qwen-14B-Chat95.35
11gemma-7B (IT)94.08
12Qwen 1.5 72B Chat93.55
13GPT-4 Turbo93.49
14Qwen 1.5 7B Chat93
15Qwen-7B Chat91.69

Interactive version: theaggregate.ai/benchmark?slug=salad-bench-base · How It Works · Data refreshed daily, snapshot 2026-09-05.