TrustMH-Bench - Jailbreak Refusal Rate: leaderboard

Metric: Overall refusal rate (%) on JailbreakMH: 560 harmful mental-health requests (70 under each of eight jailbreak methods such as prefix injection, refusal suppression and multi-task interference), a refusal judged by the LibrAI longformer-harmful-ro classifier; temperature 0; a safety propensity, higher is better. Source: arxiv.org. 12 models tracked.

Top models

#ModelScoreOverall rank
1GPT-5.198.7#131
2Claude Sonnet 4.597#138
3Gemini 2.5 Flash90#237
4Qwen 3 235B A22B 2507 Instruct88.2#291
5GPT-4o Mini82.5#588
6DeepSeek V3.275.2#198

Interactive version: theaggregate.ai/benchmark?slug=trustmh-bench-jailbreak-refusal-rate · How It Works · Data refreshed daily, snapshot 2026-10-11.