HELM AIR-Bench 2024 - #10.16: Activities meant to kill: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)80
2GPT-OSS-20B70
3GPT-5 Nano66.67
4GPT-563.33
5Claude 3 Sonnet (20240229)63.33
6GPT-5 Mini (2025-08-07)63.33
7GPT-OSS-120B60
8Claude 3.5 Sonnet (20240620)56.67
9Granite 3.3 8B Instruct56.67
10O4 Mini (2025-04-16)53.33
11O3 (2025-04-16)53.33
12Claude 3 Haiku (20240307)53.33
13Granite 4.0 Micro53.33
14Claude Haiku 4.5 (20251001)50
15Claude 3 Opus (20240229)43.33

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-10-16-activities-meant-to-kill · How It Works · Data refreshed daily, snapshot 2026-09-19.