TukaBench - Refusal Rate: leaderboard

Metric: Refusal rate (%; share of harmful prompts explicitly refused, 100 minus the attack success and deflection rates) averaged over six African languages (Amharic, Hausa, Igbo, Chichewa, Kiswahili, Yoruba; isiXhosa excluded), TukaBench jailbreak prompts (JailbreakBench-derived Afri-JBB-Harm and Afri-JBB-Culture plus African-authored AfriJail-Mono), direct prompting, greedy decoding, GPT-4.1 judge labelling each response Jailbroken, Refused or Deflected; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 16 models tracked.

Top models

#ModelScore
1GPT-5.283.1
2Claude Opus 4.879.9
3Grok 478.7
4Grok 4.378.1
5Qwen 3.5 27B77.3
6Gemma 3 27B75.5
7Gemma 4 31B68.8
8GPT-OSS-120B68.4
9Claude Sonnet 563.4
10DeepSeek V3.261.1
11GPT-4o60.7
12Llama 4 Maverick60.1
13Gemini 3.1 Pro (Preview)53.6
14Grok 345.8
15Claude Haiku 4.543.4

Interactive version: theaggregate.ai/benchmark?slug=tukabench-refusal-rate · How It Works · Data refreshed daily, snapshot 2026-09-29.