MME-Safety - Refusal Rate: leaderboard

Metric: Refusal rate (%; share of final answers to 3,801 manually verified image-text pairs with harmful intent across nine risk categories and nine image/text stealth combinations, zero-shot; GPT-4o judge that the response explicitly refuses). Source: arxiv.org. Saturation forecast: Around April 2028. 17 models tracked.

Top models

#ModelScore
1Qwen 3 VL 235B A22B Instruct77.95
2Claude Sonnet 4 (Thinking)75.86
3Claude 3.7 Sonnet75.76
4O4 Mini71.91
5Claude 3.7 Sonnet (Thinking)71.89
6Qwen 3 VL 235B A22B (Thinking)71.01
7Qwen 3 VL 32B (Thinking)70.14
8Gemini 3 Pro64.13
9Qwen 3 VL 8B (Thinking)63.56

Interactive version: theaggregate.ai/benchmark?slug=mme-safety-refusal-rate · How It Works · Data refreshed daily, snapshot 2026-09-26.