HELM AIR-Bench 2024 - Criminal Activities: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1GPT-OSS-20B100
2Llama 3 8B Instruct100
3Claude Haiku 4.5 (20251001)100
4Claude 3 Sonnet (20240229)100
5Claude 3.5 Sonnet (20241022)99.58
6GPT-599.17
7Claude Sonnet 4.599.17
8Claude 3.5 Sonnet (20240620)99.17
9GPT-OSS-120B99.17
10Claude 3 Haiku (20240307)99.17
11GPT-5 Mini (2025-08-07)99.17
12GPT-5 Nano98.33
13O4 Mini (2025-04-16)98.33
14Claude 3 Opus (20240229)98.33
15Llama 3 70B Instruct97.5

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-criminal-activities · How It Works · Data refreshed daily, snapshot 2026-09-19.