SciHazard: leaderboard

Metric: DeHarm-Score (0-5, lower is safer; the mean over 2,400 hazardous questions in 12 scientific disciplines of hazard level 1 to 5 x non-refusal x (executability + net-new risk, each 1 to 4)/8, executability from importance-weighted checklists and net-new risk from retrieval-checked claims, judged by Qwen3.5-35B-A3B; a refused answer scores 0; standard LLMs at temperature 0). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1O30.6
2Grok 4.1 Fast0.63
3Qwen 3.6 Plus0.64
4Qwen 3.5 397B A17B0.67
5O3 Mini0.72
6Claude Opus 4.60.78
7Claude Sonnet 4.60.9
8Claude Haiku 4.50.95
9Gemini 3.1 Pro (Preview)0.97
10Qwen 3.5 35B A3B0.98
11Gemini 3 Flash1.11
12Step 3.5 Flash1.32
13DeepSeek R11.33
14GPT-5.41.44
15GPT-5.21.57

Interactive version: theaggregate.ai/benchmark?slug=scihazard · How It Works · Data refreshed daily, snapshot 2026-09-29.