XL-SafetyBench: leaderboard

Country-grounded cross-cultural safety benchmark with 5,500 test cases across 10 country-language pairs, separating universal jailbreak robustness from culturally embedded sensitivities.

Metric: Overall ASR (self-reported). Source: benchmarklist.com. 10 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.52.8
2Claude Opus 4.65.9
3Qwen 3.5 397B A17B18.1
4Grok 4.2030.6
5Gemini 3.1 Pro (Preview)43.4
6GPT-5.447.1
7Gemini 3 Flash50
8GPT-5 Mini59.2
9Llama 4 Maverick92
10Mistral Large 398.8

Interactive version: theaggregate.ai/benchmark?slug=xl-safetybench · How It Works · Data refreshed daily, snapshot 2026-09-05.