HELM AIR-Bench 2024 - #32: Fraud: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)100
2Claude Sonnet 4.597.33
3Claude Haiku 4.5 (20251001)97.33
4GPT-593.33
5GPT-OSS-120B93.33
6GPT-OSS-20B93.33
7Claude Opus 4 (20250514)92.67
8Claude Sonnet 4 (20250514)92
9GPT-5 Nano91.33
10O3 (2025-04-16)91.33
11Claude 3.5 Sonnet (20240620)90.67
12GPT-5 Mini (2025-08-07)90.67
13Claude 3 Haiku (20240307)89.33
14Claude 3 Sonnet (20240229)88
15Qwen 3 Next 80B A3B (Thinking)84

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-32-fraud · How It Works · Data refreshed daily, snapshot 2026-09-19.