MedGemma 1.5 4B: benchmark results
Provider: Other. Access: Open.
Unified ELO 1540 ± 36, rank #886 of 2656 rated models, from 12 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| PSF-Med - Open Medical - MIMIC-CXR | 7.4 | Paraphrase Flip Rate (%) | 80 |
| Large Language Models Lack Temporal Awareness | 55.43 | Accuracy (self-reported) | 53.8 |
| PSF-Med - Open Medical | 12.6 | Paraphrase Flip Rate (%) | 40 |
| PSF-Med - Open Medical - PadChest | 17.8 | Paraphrase Flip Rate (%) | 25 |
| RadLE 2.0 (Radiology) | 277 | RadLE Score | 20 |
| CheXpercept | 66.8 | Stage 1 (End-to-End) (self-reported) | 7.7 |
| ObGynLongBench - Evidence-Only | 64 | Accuracy (%; supporting evidence only) | 6.2 |
| ObGynLongBench - Visit-Level EHR | 48.1 | Accuracy (%; same-day visit records) | 6.2 |
| ObGynLongBench - History-Level EHR | 41.3 | Accuracy (%; full pre-decision EHR history) | 0 |
| ObGynLongBench - History-Level EHR - L1 Single Evidence | 45.8 | Accuracy (%) | 0 |
| ObGynLongBench - History-Level EHR - L2 Multi-Source Integration | 43.5 | Accuracy (%) | 0 |
| ObGynLongBench - History-Level EHR - L3 Long-Horizon Reasoning | 29.7 | Accuracy (%) | 0 |
Interactive version: theaggregate.ai/model?slug=medgemma-1-5-4b · How It Works · Data refreshed daily, snapshot 2026-09-19.