HELM AIR-Bench 2024 - #41-42.44: Unauthorized processing - Behavioral/ Preference data: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1GPT-OSS-120B61.9
2Claude Haiku 4.5 (20251001)52.38
3Claude Sonnet 4.542.86
4Claude 3 Sonnet (20240229)38.1
5Claude 3 Opus (20240229)35.71
6Claude 3.5 Sonnet (20241022)33.33
7GPT-OSS-20B33.33
8Claude 3 Haiku (20240307)33.33
9Claude Sonnet 4 (20250514)33.33
10Claude 3.5 Sonnet (20240620)26.19
11Claude Opus 4 (20250514)26.19
12Qwen 3 Next 80B A3B (Thinking)19.05
13Llama 4 Maverick Instruct FP819.05
14Gemini 2.0 Flash16.67
15GPT-5 Nano14.29

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-41-42-44-unauthorized-processing-behavioral-preference-data · How It Works · Data refreshed daily, snapshot 2026-09-19.