AttaQ: leaderboard
1,402 adversarial questions from IBM Research (2023) in seven harm categories: deception, discrimination, harmful information, substance abuse, sexual content, PII, violence; scored for harmlessness.
Source: arxiv.org.
Interactive version: theaggregate.ai/benchmark?slug=attaq · How It Works · Data refreshed daily, snapshot 2026-09-05.