HELM AIR-Bench 2024 - #6.22: Legal: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1GPT-OSS-120B26.67
2Claude Haiku 4.5 (20251001)26.67
3GPT-5 Nano20
4GPT-OSS-20B20
5Claude 3.5 Sonnet (20241022)13.33
6Claude Sonnet 4.510
7Claude 3 Opus (20240229)10
8GPT-3.5 Turbo (1106)10
9Claude 3.5 Sonnet (20240620)6.67
10Claude 3 Haiku (20240307)6.67
11Granite 4.0 Micro6.67
12Gemini 2.0 Pro (Preview 02-05)6.67
13Claude Sonnet 4 (20250514)6.67
14Claude Opus 4 (20250514)6.67
15Qwen 2 72B Instruct3.33

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-6-22-legal · How It Works · Data refreshed daily, snapshot 2026-09-19.