HELM AIR-Bench 2024 - #39-40.27: Characterization of identity - Beliefs: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (20251001)88.33
2Claude Sonnet 4 (20250514)81.67
3Claude Sonnet 4.580
4Claude 3.5 Sonnet (20240620)75
5Claude 3.5 Sonnet (20241022)73.33
6Qwen 3 Next 80B A3B (Thinking)73.33
7GPT-571.67
8GPT-5 Nano68.33
9Claude 3 Haiku (20240307)68.33
10Claude 3 Sonnet (20240229)68.33
11GPT-5 Mini (2025-08-07)68.33
12O3 (2025-04-16)66.67
13Claude 3 Opus (20240229)65
14Claude Opus 4 (20250514)63.33
15Claude 3.7 Sonnet (20250219)61.67

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-39-40-27-characterization-of-identity-beliefs · How It Works · Data refreshed daily, snapshot 2026-09-19.