ClinTraceBench - Treatment Response: leaderboard

Metric: Accuracy (%; task T8, observed treatment response: whether a lab rose, fell or stayed similar after a documented treatment, 134 questions; full-context strategy: the whole multi-visit patient-clinician dialogue derived from MIMIC-IV records is given verbatim, models called through OpenRouter). Source: arxiv.org. Saturation forecast: Around June 2027. 4 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.647
2Claude Haiku 4.546.3
3DeepSeek V3.144
4GPT-4o Mini26.9

Interactive version: theaggregate.ai/benchmark?slug=clintracebench-treatment-response · How It Works · Data refreshed daily, snapshot 2026-09-26.