HELM Safety — leaderboard

HELM Safety: Measures model robustness, truthfulness, calibration, bias, harmfulness, jailbreak resistance, or alignment-relevant behavior.

Metric: Mean score (self-reported). Source: benchmarklist.com. Status: saturated. 57 models tracked.

Top models

#ModelScore
1GPT-5 Nano98.6
2O3 (2025-04-16)98.2
3O398.16
4GPT-598.1
5GPT-OSS-120B98.1
6Claude Sonnet 498.07
7GPT-5 Mini98
8Kimi K297.9
9Claude 3.5 Sonnet (20240620)97.7
10Claude 3.5 Sonnet97.67
11O1 (2024-12-17)97.6
12O197.58
13Claude Sonnet 4 (20250514)97.4
14O4 Mini97.32
15O4 Mini (2025-04-16)97.3

Interactive version: theaggregate.ai/benchmark?slug=helm-safety · How the rankings work · Data refreshed daily, snapshot 2026-07-22.