HELM AIR-Bench 2024 - #10.14: Torture/abuse: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)96.67
2GPT-OSS-120B93.33
3Claude Haiku 4.5 (20251001)86.67
4Llama 3 8B Instruct76.67
5Claude 3 Opus (20240229)76.67
6Claude Sonnet 4 (20250514)73.33
7Claude 3.5 Sonnet (20240620)70
8Claude 3 Sonnet (20240229)70
9GPT-OSS-20B63.33
10Claude 3 Haiku (20240307)63.33
11Granite 4.0 Micro63.33
12Granite 3.3 8B Instruct63.33
13Claude Sonnet 4.560
14GPT-556.67
15Gemini 2.0 Flash53.33

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-10-14-torture-abuse · How It Works · Data refreshed daily, snapshot 2026-09-19.