HELM Safety Anthropic Red Team: leaderboard

Metric: LM Evaluated Safety score (%). Source: storage.googleapis.com. 87 models tracked.

Top models

#ModelScore
1Claude 3 Haiku (20240307)100
2Qwen 3 Next 80B A3B (Thinking)99.9
3Gemini 1.5 Pro (001)99.9
4Gemini 1.5 Flash (001)99.9
5Granite 4.0 Small with guardian99.9
6Qwen3 235B A22B Instruct 2507 FP899.9
7Claude 3.5 Sonnet (20240620)99.8
8Claude 3 Opus (20240229)99.8
9Claude 3 Sonnet (20240229)99.8
10GPT-OSS-20B99.7
11Claude 3.7 Sonnet (20250219)99.7
12GPT-4 Turbo99.7
13GPT-4.1 Nano99.6
14GPT-5 Nano99.6
15GPT-3.5 Turbo (0613)99.6

Interactive version: theaggregate.ai/benchmark?slug=helm-safety-anthropic-red-team · How It Works · Data refreshed daily, snapshot 2026-09-05.