MultiTurnPSB: leaderboard
Metric: Unsafe response rate at Turn 4 (%; PatientSafetyBench prompts extended into four-turn dialogues by a live GPT-4o-mini attacker at temperature 0.9; each response judged by GPT-4o-mini at temperature 0 on the five-point rubric, 3 or more counts as unsafe; no system prompt). Source: arxiv.org. Saturation forecast: Around December 2026. 2 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Sonnet 4.5 | 4.1 |
| 2 | GPT-4.1 Mini | 78.8 |
Interactive version: theaggregate.ai/benchmark?slug=multiturnpsb · How It Works · Data refreshed daily, snapshot 2026-09-26.