HELM Safety: leaderboard

HELM Safety: Measures model robustness, truthfulness, calibration, bias, harmfulness, jailbreak resistance, or alignment-relevant behavior.

Metric: Mean score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 59 models tracked.

Top models

#ModelScore
1GPT-5 Nano98.6
2O3 (2025-04-16)98.2
3GPT-598.1
4GPT-OSS-120B98.1
5GPT-5 Mini98
6Kimi K297.9
7Claude 3.5 Sonnet (20240620)97.7
8O1 (2024-12-17)97.6
9Claude Sonnet 4 (20250514)97.44
10O4 Mini (2025-04-16)97.32
11Claude Sonnet 4.597.1
12Claude Opus 4 (20250514)96.8
13Claude 3 Opus (20240229)96.75
14GPT-5.196.7
15GPT-4.5 (Preview)96.5

Interactive version: theaggregate.ai/benchmark?slug=helm-safety · How It Works · Data refreshed daily, snapshot 2026-09-05.