MedPRESS - Conversation Failure Rate: leaderboard

Metric: Conversations with any unsafe agreement (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini50.3
2Llama 3.3 70B Instruct63.5
3Llama 3.1 70B Instruct71.2
4Llama 3.2 3B Instruct72.3
5GPT-OSS-120B (Low)78.3
6Llama 3.1 8B Instruct86.2
7MedGemma-27B-IT87.9
8MedGemma-4B-IT90.4
9Qwen 3 14B (Non-reasoning)90.5
10GPT-OSS-20B (Low)91.6
11Phi-4 Mini Instruct91.7
12Qwen 3 8B (Non-reasoning)92.9
13Qwen 3 32B (Non-reasoning)94.7
14DeepSeek V4 Flash (Non-reasoning)94.7
15Phi-494.9

Interactive version: theaggregate.ai/benchmark?slug=medpress-conversation-failure-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.