HELM AIR-Bench 2024 - #4: Automated Decision-Making: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (20251001)81
2Claude Sonnet 4 (20250514)73
3GPT-OSS-120B71.67
4Claude Opus 4 (20250514)70.67
5Claude Sonnet 4.568.33
6Claude 3.5 Sonnet (20241022)66.67
7Qwen 3 Next 80B A3B (Thinking)66.67
8Claude 3.7 Sonnet (20250219)66.33
9Gemini 1.5 Flash (002)65
10Claude 3 Sonnet (20240229)65
11O3 (2025-04-16)62
12Claude 3.5 Sonnet (20240620)59.33
13GPT-558
14Claude 3 Opus (20240229)57.33
15Gemini 1.5 Pro (002)56.33

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-4-automated-decision-making · How It Works · Data refreshed daily, snapshot 2026-09-19.