MIR-SafetyBench: leaderboard

Metric: Attack Success Rate (%; lower is safer). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1GPT-5.115.25
2Gemini 3 Pro (Preview)39.2
3Gemini 2.5 Pro50.15
4GPT-4o Mini58.63
5Gemini 2.5 Flash64.16
6GPT-4o69.58
7QVQ-72B-Preview71.11
8InternVL3-78B74.33
9InternVL3-8B77.8
10InternVL3-38B81.43
11Qwen 2.5 VL 32B Instruct85.61
12GLM-4.1V-9B (Thinking)87.63

Interactive version: theaggregate.ai/benchmark?slug=mir-safetybench · How It Works · Data refreshed daily, snapshot 2026-09-25.