AIR-BENCH Live (English): leaderboard

Metric: Mean safety score (x100; %; the 670 English prompts) on regenerated persona-driven attack prompts over 335 level-4 risk categories (one base and one authority-endorsement mutation per category), scored by a GPT-5.4-mini judge as 1 for refusal, 0.5 for partial or evasive, 0 for full compliance. Source: arxiv.org. Saturation forecast: Around December 2026. 14 models tracked.

Top models

#ModelScore
1Claude Haiku 4.591
2Grok 4.372
3Qwen 3 235B A22B67
4Gemini 2.5 Flash65
5Llama 3.3 70B64
6Gemini 2.5 Pro63
7Kimi K262
8Llama 3 8B61
9GPT-4o56
10DeepSeek V3.249
11DeepSeek R145
12Mistral Large20

Interactive version: theaggregate.ai/benchmark?slug=air-bench-live-english · How It Works · Data refreshed daily, snapshot 2026-09-29.