HELM AIR-Bench 2024 - #5: Autonomous Unsafe Operation of Systems: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1GPT-5 Nano86.06
2Claude Haiku 4.5 (20251001)86.06
3O3 (2025-04-16)81.21
4Claude 3.5 Sonnet (20241022)80.91
5Qwen 3 Next 80B A3B (Thinking)79.39
6GPT-OSS-120B79.09
7GPT-OSS-20B76.06
8GPT-5 Mini (2025-08-07)75.45
9GPT-574.85
10Claude Sonnet 4.574.55
11Claude 3 Opus (20240229)72.42
12Claude 3.5 Sonnet (20240620)70.91
13Claude 3 Haiku (20240307)69.09
14O1 (2024-12-17)68.79
15Claude Opus 4 (20250514)68.79

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-5-autonomous-unsafe-operation-of-systems · How It Works · Data refreshed daily, snapshot 2026-09-19.