MIR-SafetyBench - Semantic Relevance: leaderboard

Metric: Attack Success Rate (%; lower is safer). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1GPT-5.111.84
2Gemini 3 Pro (Preview)36.84
3Gemini 2.5 Pro38.16
4Gemini 2.5 Flash51.97
5GPT-4o52.63
6GPT-4o Mini52.63
7InternVL3-78B60.53
8QVQ-72B-Preview60.53
9InternVL3-38B69.74
10InternVL3-8B73.68
11GLM-4.1V-9B (Thinking)77.63
12Qwen 2.5 VL 32B Instruct82.24

Interactive version: theaggregate.ai/benchmark?slug=mir-safetybench-semantic-relevance · How It Works · Data refreshed daily, snapshot 2026-09-25.