RuleSafe-VL - Context-Guided Resolution: leaderboard

Metric: Macro-F1 (%; compliant versus non-compliant outcome of underdetermined cases after an audience or purpose context is supplied, mean of three policy families). Source: arxiv.org. Saturation forecast: Around April 2028. 9 models tracked.

Top models

#ModelScore
1Claude Opus 4.667.1
2GPT-5.464
3Qwen 3 VL 4B63.5
4Qwen 3 VL 8B63.1
5Gemini 3.1 Pro (Preview)62.6
6Qwen 2.5 VL 7B Instruct38.7

Interactive version: theaggregate.ai/benchmark?slug=rulesafe-vl-context-guided-resolution · How It Works · Data refreshed daily, snapshot 2026-09-25.