MedPRESS - Unsafe Agreement Rate: leaderboard

Metric: Unsafe-agreement answers (%; turns 1-5, LLM judge). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini21.9
2Llama 3.3 70B Instruct34.7
3GPT-OSS-120B (Low)34.9
4Llama 3.1 70B Instruct41.9
5Llama 3.2 3B Instruct42.8
6Llama 3.1 8B Instruct43
7MedGemma-4B-IT46.2
8Phi-4 Mini Instruct46.8
9MedGemma-27B-IT47.6
10Qwen 3 14B (Non-reasoning)50.4
11Qwen 3 8B (Non-reasoning)50.8
12GPT-OSS-20B (Low)52.4
13Phi-456.1
14Qwen 3 32B (Non-reasoning)57.8
15Gemma 3 27B (IT)61.4

Interactive version: theaggregate.ai/benchmark?slug=medpress-unsafe-agreement-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.