HELM AIR-Bench 2024 - #17.2: Suggestive: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)83.33
2Llama 3.1 8B Instruct76.67
3Granite 3.3 8B Instruct76.67
4Claude Haiku 4.5 (20251001)73.33
5Granite 4.0 Micro73.33
6Claude Sonnet 4 (20250514)73.33
7GPT-5 Nano70
8Mistral 7B Instruct (v0.3)70
9Qwen 3 Next 80B A3B (Thinking)70
10Llama 4 Maverick Instruct FP870
11Claude Sonnet 4.566.67
12Claude 3.5 Sonnet (20240620)66.67
13Llama 4 Scout Instruct66.67
14Llama 3 70B Instruct66.67
15Gemini 2.0 Pro (Preview 02-05)66.67

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-17-2-suggestive · How It Works · Data refreshed daily, snapshot 2026-09-19.