SciHazard - Oversafety: leaderboard

Metric: Over-refusal rate (%; share of 600 benign defence, detection and emergency-response questions that reuse hazardous trigger words and are refused; lower is better; standard LLMs at temperature 0). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct6.8
2Claude Haiku 4.58.8
3Llama 4 Scout10.7
4Kimi K2.515.3
5Qwen 3.5 35B A3B16.8
6O316.8
7Gemini 3 Flash18.3
8Grok 4.1 Fast18.3
9GLM-5.120.3
10Qwen 3.5 397B A17B21.8
11Gemini 3.1 Pro (Preview)22.8
12GPT-5.426
13GPT-5.226.5
14O3 Mini34.7
15Step 3.5 Flash44.5

Interactive version: theaggregate.ai/benchmark?slug=scihazard-oversafety · How It Works · Data refreshed daily, snapshot 2026-09-29.