MedGemma 1.5 4B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1540 ± 36, rank #886 of 2656 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
PSF-Med - Open Medical - MIMIC-CXR7.4Paraphrase Flip Rate (%)80
Large Language Models Lack Temporal Awareness55.43Accuracy (self-reported)53.8
PSF-Med - Open Medical12.6Paraphrase Flip Rate (%)40
PSF-Med - Open Medical - PadChest17.8Paraphrase Flip Rate (%)25
RadLE 2.0 (Radiology)277RadLE Score20
CheXpercept66.8Stage 1 (End-to-End) (self-reported)7.7
ObGynLongBench - Evidence-Only64Accuracy (%; supporting evidence only)6.2
ObGynLongBench - Visit-Level EHR48.1Accuracy (%; same-day visit records)6.2
ObGynLongBench - History-Level EHR41.3Accuracy (%; full pre-decision EHR history)0
ObGynLongBench - History-Level EHR - L1 Single Evidence45.8Accuracy (%)0
ObGynLongBench - History-Level EHR - L2 Multi-Source Integration43.5Accuracy (%)0
ObGynLongBench - History-Level EHR - L3 Long-Horizon Reasoning29.7Accuracy (%)0

Interactive version: theaggregate.ai/model?slug=medgemma-1-5-4b · How It Works · Data refreshed daily, snapshot 2026-09-19.