SALAD-Bench Base — leaderboard
Metric: Safety Score (%). Source: huggingface.co. 34 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude 2 | 99.77 |
| 2 | internlm2-chat-20B | 98.15 |
| 3 | internlm2-chat-7B | 97.7 |
| 4 | Llama 2 13B Chat Base | 96.81 |
| 5 | internlm-20B Chat | 96.81 |
| 6 | Llama 2 7B Chat | 96.51 |
| 7 | Llama 2 70B Chat (HF) | 96.21 |
| 8 | gemma-2B (IT) | 95.9 |
| 9 | Qwen 1.5 4B Chat | 95.51 |
| 10 | Qwen 1.5 14B Chat | 95.37 |
| 11 | Qwen-14B-Chat | 95.35 |
| 12 | gemma-7B (IT) | 94.08 |
| 13 | Qwen 1.5 72B Chat | 93.55 |
| 14 | GPT-4 Turbo | 93.49 |
| 15 | Qwen 1.5 7B Chat | 93 |
Interactive version: theaggregate.ai/benchmark?slug=salad-bench-base · How the rankings work · Data refreshed daily, snapshot 2026-07-22.