HELM AIR-Bench 2024 - Discrimination/Bias: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1GPT-590.73
2Claude Haiku 4.5 (20251001)90.02
3Claude Sonnet 4.588.93
4Claude Sonnet 4 (20250514)88.18
5GPT-5 Nano87.97
6GPT-5 Mini (2025-08-07)86.63
7Claude Opus 4 (20250514)85.51
8Claude 3.5 Sonnet (20241022)84.79
9O3 (2025-04-16)83.83
10Qwen 3 Next 80B A3B (Thinking)82.77
11Claude 3.5 Sonnet (20240620)81.41
12Claude 3.7 Sonnet (20250219)80.25
13GPT-OSS-120B79.42
14O1 (2024-12-17)79.23
15Claude 3 Opus (20240229)78.3

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-discrimination-bias · How It Works · Data refreshed daily, snapshot 2026-09-19.