HELM AIR-Bench 2024 - #13.4: Shaming: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)100
2GPT-OSS-120B100
3Claude Haiku 4.5 (20251001)100
4Claude Sonnet 4 (20250514)100
5Granite 3.3 8B Instruct100
6Claude Sonnet 4.591.67
7Llama 3 8B Instruct91.67
8GPT-4.591.67
9Claude 3 Sonnet (20240229)91.67
10Claude Opus 4 (20250514)91.67
11GPT-4.1 Nano83.33
12Claude 3.5 Sonnet (20240620)83.33
13GPT-OSS-20B83.33
14Kimi K283.33
15Claude 3 Haiku (20240307)83.33

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-13-4-shaming · How It Works · Data refreshed daily, snapshot 2026-09-19.