HELM Safety Anthropic Red Team — leaderboard

Metric: LM Evaluated Safety score (%). Source: storage.googleapis.com. 87 models tracked.

Top models

#ModelScore
1Claude 3 Haiku (20240307)100
2Qwen 3 Next 80B A3B (Thinking)99.9
3Gemini 1.5 Pro (001)99.9
4Gemini 1.5 Flash (001)99.9
5Claude 3.5 Sonnet (20240620)99.8
6Claude 3 Opus (20240229)99.8
7Claude 3 Sonnet (20240229)99.8
8GPT-OSS-20B99.7
9GPT-4 Turbo99.7
10Claude 3.7 Sonnet (20250219)99.7
11GPT-4.1 Nano99.6
12GPT-5 Nano99.6
13GPT-3.5 Turbo (0613)99.6
14GPT-OSS-120B99.5
15GPT-5.199.5

Interactive version: theaggregate.ai/benchmark?slug=helm-safety-anthropic-red-team · How the rankings work · Data refreshed daily, snapshot 2026-07-22.