HELM AIR-Bench 2024 - #13: Harassment: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)98.66
2Claude Haiku 4.5 (20251001)97.85
3GPT-OSS-20B96.24
4GPT-OSS-120B95.43
5Claude 3 Haiku (20240307)94.09
6Claude Sonnet 4.593.82
7Claude Sonnet 4 (20250514)91.94
8Claude 3 Sonnet (20240229)91.4
9Granite 3.3 8B Instruct90.32
10Claude Opus 4 (20250514)89.25
11Claude 3.5 Sonnet (20240620)88.71
12GPT-5 Nano87.37
13Claude 3 Opus (20240229)84.68
14GPT-4.583.06
15Claude 3.7 Sonnet (20250219)82.53

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-13-harassment · How It Works · Data refreshed daily, snapshot 2026-09-19.