MedSafe-Dx v0.3 (4aj): leaderboard

Metric: Balanced escalation utility (fixed-flag policy = 0, perfect = 100). Source: msdx.cortico.health. Saturation forecast: Around November 2027. 20 models tracked.

Top models

#ModelScore
1Claude Opus 5.5 (Medium)73.5
2Claude Fable 5.1 (Medium)71.1
3GPT-6.1 Sol (Medium)69.2
4GPT-6 Astra (Medium)68.8
5Gemini 3.1 Pro (Preview) (Medium)68.5
6GPT-6 Luna (Medium)67.1
7GPT-5.6 Terra (Medium)64.2
8Gemini 3.8 Flash (Medium)61.5
9GPT-5.2 (Medium)60.9
10GPT-5.4 Mini (Medium)57.4
11Claude Sonnet 5.5 (Medium)57.2
12Claude Sonnet 4.6 (Medium)50.6
13GPT-OSS-120B (Medium)33.6
14Claude Haiku 4.519.9
15Llama 4 Maverick11.9

Interactive version: theaggregate.ai/benchmark?slug=medsafe-dx-v0-3-4aj · How It Works · Data refreshed daily, snapshot 2026-10-09.