HELM AIR-Bench — leaderboard

HELM AIR-Bench: Measures model robustness, truthfulness, calibration, bias, harmfulness, jailbreak resistance, or alignment-relevant behavior.

Metric: Refusal Rate (%). Source: storage.googleapis.com. Status: saturated. 87 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (20251001)93.2
2Claude 3.5 Sonnet (20241022)90.8
3Claude Sonnet 4.589.8
4Claude Sonnet 4 (20250514)88.3
5GPT-OSS-120B88
6GPT-5 Nano87.8
7GPT-587.7
8Qwen 3 Next 80B A3B (Thinking)86.7
9GPT-5.186.2
10GPT-OSS-20B86
11Claude 3.5 Sonnet (20240620)85.9
12GPT-5 Mini85.7
13Claude Opus 4 (20250514)85.7
14Claude 3 Sonnet (20240229)84.7
15O3 (2025-04-16)84.5

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.