RedBench - HarmBench ASR (RainbowPlus): leaderboard

Metric: Attack Success Rate (%; HarmBench test behaviors, Llama-Guard-3-8B judge; RainbowPlus quality-diversity search). Source: arxiv.org. Saturation forecast: Estimated already saturated. 6 models tracked.

Top models

#ModelScore
1GPT-4.1 Nano6.88
2GPT-4o Mini28.75
3Gemma 2 9B (IT)42.5
4Qwen 2.5 7B Instruct84.06
5Llama 3.1 8B Instruct96.25
6Ministral-8B-Instruct-241097.81

Interactive version: theaggregate.ai/benchmark?slug=redbench-harmbench-asr-rainbowplus · How It Works · Data refreshed daily, snapshot 2026-09-25.