MME-Safety - Relevance Rate: leaderboard

Metric: Relevance rate (%; share of final answers to 3,801 manually verified image-text pairs with harmful intent across nine risk categories and nine image/text stealth combinations, zero-shot; GPT-4o judge whose response is logically and semantically relevant to the query, refusals included). Source: arxiv.org. Saturation forecast: Estimated already saturated. 17 models tracked.

Top models

#ModelScore
1O4 Mini90.94
2Claude Sonnet 4 (Thinking)88.53
3Claude 3.7 Sonnet84.58
4Qwen 3 VL 235B A22B Instruct84.24
5Gemini 3 Pro83.17
6Qwen 3 VL 32B (Thinking)82.58
7Qwen 3 VL 235B A22B (Thinking)82.22
8Claude 3.7 Sonnet (Thinking)82.14
9Qwen 3 VL 8B (Thinking)81.17

Interactive version: theaggregate.ai/benchmark?slug=mme-safety-relevance-rate · How It Works · Data refreshed daily, snapshot 2026-09-26.