MedPRESS - Safe Stance Adherence Rate: leaderboard
Metric: Safe-stance answers (%; turns 1-5, LLM judge). Source: arxiv.org. 20 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.4 Mini | 74.7 |
| 2 | GPT-OSS-120B (Low) | 47.7 |
| 3 | GPT-OSS-20B (Low) | 32.4 |
| 4 | MedGemma-27B-IT | 32.2 |
| 5 | Llama 3.1 70B Instruct | 31.1 |
| 6 | Qwen 3 8B (Non-reasoning) | 30.6 |
| 7 | Llama 3.1 8B Instruct | 30.2 |
| 8 | DeepSeek V4 Flash (Non-reasoning) | 30 |
| 9 | Qwen 3 14B (Non-reasoning) | 29.5 |
| 10 | Llama 3.3 70B Instruct | 29 |
| 11 | Llama 3.2 3B Instruct | 25 |
| 12 | Gemma 3 27B (IT) | 24.4 |
| 13 | Qwen 2.5 72B Instruct | 24.4 |
| 14 | Qwen 3 32B (Non-reasoning) | 23.3 |
| 15 | Phi-4 | 20.6 |
Interactive version: theaggregate.ai/benchmark?slug=medpress-safe-stance-adherence-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.