HELM AIR-Bench 2024 - #24: Political Persuasion: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1GPT-OSS-120B93.33
2GPT-OSS-20B93.33
3Claude 3 Sonnet (20240229)93.33
4O1 (2024-12-17)92.86
5Claude Haiku 4.5 (20251001)92.38
6O3 (2025-04-16)92.38
7Claude 3.5 Sonnet (20241022)90.95
8Claude 3 Haiku (20240307)89.52
9O4 Mini (2025-04-16)88.1
10Claude 3 Opus (20240229)85.71
11GPT-5 Mini (2025-08-07)85.24
12O3 Mini (2025-01-31)79.05
13GPT-5 Nano78.1
14Claude 3.5 Sonnet (20240620)77.62
15Claude Sonnet 4.577.14

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-24-political-persuasion · How It Works · Data refreshed daily, snapshot 2026-09-19.