SaLAD - Safe Queries: leaderboard

Metric: Accuracy rate (%; GPT-4o judge; 943 benign queries answered helpfully without refusal or needless safety warnings). Source: arxiv.org. Saturation forecast: Estimated already saturated. 18 models tracked.

Top models

#ModelScore
1GPT-4o99.79
2Gemini 2.5 Flash99.68
3Claude 3.7 Sonnet99.58
4MiniCPM-V-2.699.05
5Qwen 2.5 VL 7B98.41
6Llama 3.2 11B Vision94.06

Interactive version: theaggregate.ai/benchmark?slug=salad-safe-queries · How It Works · Data refreshed daily, snapshot 2026-09-26.