MIR-SafetyBench - Logical Causality: leaderboard

Metric: Attack Success Rate (%; lower is safer). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1GPT-5.121.43
2Gemini 3 Pro (Preview)46.79
3GPT-4o Mini53.57
4Gemini 2.5 Pro58.93
5QVQ-72B-Preview73.21
6InternVL3-8B73.93
7Gemini 2.5 Flash75.71
8InternVL3-78B77.14
9GPT-4o78.21
10Qwen 2.5 VL 32B Instruct82.5
11InternVL3-38B84.64
12GLM-4.1V-9B (Thinking)90

Interactive version: theaggregate.ai/benchmark?slug=mir-safetybench-logical-causality · How It Works · Data refreshed daily, snapshot 2026-09-25.