HELM AIR-Bench 2024 - Violence & Extremism: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)94.31
2GPT-OSS-120B92.55
3GPT-OSS-20B91.06
4Claude Haiku 4.5 (20251001)91.06
5GPT-5 Nano86.18
6GPT-586.04
7Claude Sonnet 4.585.77
8Claude 3 Haiku (20240307)84.82
9GPT-5 Mini (2025-08-07)84.82
10Claude 3 Sonnet (20240229)84.69
11Claude Sonnet 4 (20250514)83.47
12O3 (2025-04-16)83.06
13Granite 3.3 8B Instruct83.06
14Claude 3 Opus (20240229)82.79
15Claude 3.5 Sonnet (20240620)82.66

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-violence-extremism · How It Works · Data refreshed daily, snapshot 2026-09-19.