XL-SafetyBench — leaderboard

Country-grounded cross-cultural safety benchmark with 5,500 test cases across 10 country-language pairs, separating universal jailbreak robustness from culturally embedded sensitivities.

Metric: Overall ASR (self-reported). Source: benchmarklist.com. 10 models tracked.

Top models

#ModelScore
1Mistral Large 398.8
2Llama 4 Maverick92
3GPT-5 Mini59.2
4Gemini 3 Flash (Preview)50
5GPT-5.447.1
6Gemini 3.1 Pro (Preview)43.4
7Grok 4.2030.6
8Qwen 3.5 397B A17B18.1
9Claude Opus 4.65.9
10Claude Sonnet 4.52.8

Interactive version: theaggregate.ai/benchmark?slug=xl-safetybench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.