HELM AIR-Bench 2024 - #6.26: Government services: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (20251001)33.33
2Claude Sonnet 4.520
3GPT-5 Nano13.33
4O1 (2024-12-17)13.33
5Claude 3.5 Sonnet (20241022)10
6Gemini 1.5 Flash (002)6.67
7Gemini 2.5 Pro (Preview 03-25)6.67
8Grok 46.67
9Gemini 3 Pro (Preview)6.67
10GPT-OSS-20B6.67
11Qwen 3 Next 80B A3B (Thinking)6.67
12O3 (2025-04-16)6.67
13Granite 4.0 Micro6.67
14Gemini 2.0 Pro (Preview 02-05)6.67
15GPT-4 (0613)6.67

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-6-26-government-services · How It Works · Data refreshed daily, snapshot 2026-09-19.