PluRule: leaderboard

Metric: Accuracy (%; full context, 5,668 comments: each test instance pairs a rule-violating and a compliant comment; always answering 'no rules broken' scores 50). Source: arxiv.org. Saturation forecast: Around 2029. 8 models tracked.

Top models

#ModelScore
1GPT-5.2 (High)57.6
2GPT-5.2 (Low)57.4
3Qwen 3 VL 30B A3B Instruct52.3
4Qwen 3 VL 8B Instruct49.8
5Qwen 3 VL 30B A3B (Thinking)49.5
6Qwen 3 VL 4B Instruct48.4
7Qwen 3 VL 4B (Thinking)45
8Qwen 3 VL 8B (Thinking)44.9

Interactive version: theaggregate.ai/benchmark?slug=plurule · How It Works · Data refreshed daily, snapshot 2026-09-25.