RedBench - OR-Bench Over-Refusal: leaderboard

Metric: Rejection Rate (%; 1,319 OR-Bench prompts that sound harmful but are benign, GPT-4o refusal judge). Source: arxiv.org. Saturation forecast: Estimated already saturated. 6 models tracked.

Top models

#ModelScore
1Gemma 2 9B (IT)17.45
2Ministral-8B-Instruct-241017.57
3Qwen 2.5 7B Instruct21.11
4GPT-4o Mini22.22
5Llama 3.1 8B Instruct25.4
6GPT-4.1 Nano35.18

Interactive version: theaggregate.ai/benchmark?slug=redbench-or-bench-over-refusal · How It Works · Data refreshed daily, snapshot 2026-09-25.