KSAFE-MM - Culture-Specific Risks: leaderboard

Metric: Attack Success Rate (%; responses judged harmful by a GPT-5 nano or Qwen3-235B judge, KSAFE-MM-C, template and jailbreak queries; lower is better). Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1GPT-5 Nano14.5
2Qwen 3 VL 8B23.3
3Ministral 3 8B32.6
4Gemini 3.1 Flash Lite32.8
5Ministral 3 14B32.9
6Phi-4 Multimodal Instruct33
7Gemma 3 12B43.1
8Gemma 3 27B48.6

Interactive version: theaggregate.ai/benchmark?slug=ksafe-mm-culture-specific-risks · How It Works · Data refreshed daily, snapshot 2026-09-25.