RedBench - HarmBench ASR (Direct Request): leaderboard

Metric: Attack Success Rate (%; HarmBench test behaviors, Llama-Guard-3-8B judge; raw behavior prompts). Source: arxiv.org. Saturation forecast: Estimated already saturated. 6 models tracked.

Top models

#ModelScore
1GPT-4.1 Nano3.44
2GPT-4o Mini8.75
3Gemma 2 9B (IT)11.25
4Qwen 2.5 7B Instruct32.81
5Llama 3.1 8B Instruct47.5
6Ministral-8B-Instruct-241065

Interactive version: theaggregate.ai/benchmark?slug=redbench-harmbench-asr-direct-request · How It Works · Data refreshed daily, snapshot 2026-09-25.