AttaQ: leaderboard

1,402 adversarial questions from IBM Research (2023) in seven harm categories: deception, discrimination, harmful information, substance abuse, sexual content, PII, violence; scored for harmlessness.

Source: arxiv.org.

Interactive version: theaggregate.ai/benchmark?slug=attaq · How It Works · Data refreshed daily, snapshot 2026-09-05.