ML-Bench (Multilingual Safety) - Attack-Enhanced Accuracy: leaderboard

Metric: Accuracy (%; share of refined unsafe queries with PAIR/AutoDAN-optimized adversarial suffixes classified unsafe, guardrail given only the input text). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 12 models tracked.

Top models

#ModelScore
1ML-Guard-7B90
2ML-Guard-1.5B50
3Llama-Guard-3-1B45
4DuoGuard-1.5B-transfer20
5Llama-Guard-4-12B18
6Llama-3.1-Nemotron-Safety-Guard-8B-v318
7PolyGuard-Qwen7
8Qwen3Guard-Gen-0.6B6
9Llama-Guard-3-8B3
10Qwen3Guard-Gen-8B2

Interactive version: theaggregate.ai/benchmark?slug=ml-bench-multilingual-safety-attack-enhanced-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-26.