TukaBench - Benign Compliance: leaderboard

Metric: Compliance rate (%; share of the 100 benign JailbreakBench prompts answered rather than refused or deflected) averaged over English and six African languages (isiXhosa excluded), direct prompting, greedy decoding, GPT-4.1 judge; higher is better. Source: arxiv.org. Saturation forecast: Around 2035. 8 models tracked.

Top models

#ModelScore
1Grok 4.340.7
2Grok 339.1
3Claude Haiku 4.539
4GPT-4o33
5Llama 4 Maverick31.9
6Claude Opus 4.831.4
7DeepSeek V3.230.1
8GPT-5.222.9

Interactive version: theaggregate.ai/benchmark?slug=tukabench-benign-compliance · How It Works · Data refreshed daily, snapshot 2026-09-29.