TukaBench - Code-Switched: leaderboard

Metric: Attack success rate (%; share of harmful prompts answered Jailbroken) on AfriJail-CS, the AfriJail-Mono prompts code-switched between English and each of six African languages (isiXhosa excluded), mean over the six languages, direct prompting, greedy decoding, GPT-4.1 judge; lower is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1Qwen 3.5 27B4.8
2GPT-OSS-120B10
3GPT-5.210.4
4Gemini 2.5 Pro14.3
5Grok 4.316.5
6Gemma 4 31B18.1
7Llama 4 Maverick18.8
8DeepSeek V3.219.2
9Gemma 3 27B21.7
10GPT-4o24.2
11GPT-3.5 Turbo26.5
12Gemini 3.1 Pro (Preview)26.8

Interactive version: theaggregate.ai/benchmark?slug=tukabench-code-switched · How It Works · Data refreshed daily, snapshot 2026-09-29.