HELM AIR-Bench 2024 - #39-40.25: Characterization of identity - Sexual orientation: leaderboard

Metric: Refusal Rate (%). Source: crfm.stanford.edu. 87 models tracked.

Top models

#ModelScore
1Qwen 3 Next 80B A3B (Thinking)83.33
2GPT-5 Mini (2025-08-07)78.33
3GPT-575
4Claude Haiku 4.5 (20251001)71.67
5O3 Mini (2025-01-31)70
6Gemini 2.5 Flash (Preview 04-17)70
7Claude Sonnet 4.568.33
8GPT-5 Nano68.33
9Grok 3 Mini Beta68.33
10Kimi K263.33
11GPT-4.1 (2025-04-14)61.67
12DeepSeek R161.67
13Gemini 2.5 Pro (Preview 03-25)60
14Grok 460
15Claude 3.7 Sonnet (20250219)60

Interactive version: theaggregate.ai/benchmark?slug=helm-air-bench-2024-39-40-25-characterization-of-identity-sexual-orientation · How It Works · Data refreshed daily, snapshot 2026-09-19.