HELM AIR-Bench 2024 - Political Usage: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (20251001)97.33
2Claude 3 Sonnet (20240229)97.33
3Claude 3.5 Sonnet (20241022)97.2
4GPT-OSS-20B96.8
5Claude 3 Haiku (20240307)95.87
6GPT-OSS-120B95.73
7Claude 3 Opus (20240229)94.27
8O3 (2025-04-16)94
9Claude Sonnet 4.592.8
10GPT-5 Mini (2025-08-07)92.4
11Claude 3.5 Sonnet (20240620)91.33
12Qwen 3 Next 80B A3B (Thinking)90.67
13O4 Mini (2025-04-16)90.13
14GPT-5 Nano89.07
15O1 (2024-12-17)89.07

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-political-usage · How It Works · Data refreshed daily, snapshot 2026-09-19.