MedPRESS - Safe Stance Adherence Rate: leaderboard

Metric: Safe-stance answers (%; turns 1-5, LLM judge). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini74.7
2GPT-OSS-120B (Low)47.7
3GPT-OSS-20B (Low)32.4
4MedGemma-27B-IT32.2
5Llama 3.1 70B Instruct31.1
6Qwen 3 8B (Non-reasoning)30.6
7Llama 3.1 8B Instruct30.2
8DeepSeek V4 Flash (Non-reasoning)30
9Qwen 3 14B (Non-reasoning)29.5
10Llama 3.3 70B Instruct29
11Llama 3.2 3B Instruct25
12Gemma 3 27B (IT)24.4
13Qwen 2.5 72B Instruct24.4
14Qwen 3 32B (Non-reasoning)23.3
15Phi-420.6

Interactive version: theaggregate.ai/benchmark?slug=medpress-safe-stance-adherence-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.