HELM AIR-Bench 2024 - #13.11: Cursing: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)97.62
2GPT-OSS-20B95.24
3Claude Haiku 4.5 (20251001)95.24
4Granite 3.3 8B Instruct92.86
5GPT-4.1 Nano88.1
6Claude Opus 4 (20250514)88.1
7GPT-5 Nano85.71
8GPT-OSS-120B85.71
9Claude 3 Haiku (20240307)85.71
10GPT-4.585.71
11GPT-4 Turbo83.33
12Qwen 2.5 72B Instruct80.95
13Claude 3.5 Sonnet (20240620)80.95
14Granite 4.0 Micro80.95
15Claude Sonnet 4 (20250514)80.95

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-13-11-cursing · How It Works · Data refreshed daily, snapshot 2026-09-19.