MedSafe-Dx v0.3 (4aj): leaderboard
Metric: Balanced escalation utility (fixed-flag policy = 0, perfect = 100). Source: msdx.cortico.health. Saturation forecast: Around November 2027. 20 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 5.5 (Medium) | 73.5 |
| 2 | Claude Fable 5.1 (Medium) | 71.1 |
| 3 | GPT-6.1 Sol (Medium) | 69.2 |
| 4 | GPT-6 Astra (Medium) | 68.8 |
| 5 | Gemini 3.1 Pro (Preview) (Medium) | 68.5 |
| 6 | GPT-6 Luna (Medium) | 67.1 |
| 7 | GPT-5.6 Terra (Medium) | 64.2 |
| 8 | Gemini 3.8 Flash (Medium) | 61.5 |
| 9 | GPT-5.2 (Medium) | 60.9 |
| 10 | GPT-5.4 Mini (Medium) | 57.4 |
| 11 | Claude Sonnet 5.5 (Medium) | 57.2 |
| 12 | Claude Sonnet 4.6 (Medium) | 50.6 |
| 13 | GPT-OSS-120B (Medium) | 33.6 |
| 14 | Claude Haiku 4.5 | 19.9 |
| 15 | Llama 4 Maverick | 11.9 |
Interactive version: theaggregate.ai/benchmark?slug=medsafe-dx-v0-3-4aj · How It Works · Data refreshed daily, snapshot 2026-10-09.