MedGemma-27B: benchmark results
Provider: Other.
Unified ELO 1600 ± 24, rank #451 of 1605 rated models, from 21 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| PSF-Med - Open Medical | 9.47 | Paraphrase Flip Rate (%) | 100 |
| PSF-Med - Open Medical - MIMIC-CXR | 6.4 | Paraphrase Flip Rate (%) | 100 |
| PSF-Med - Open Medical - VinDr-CXR | 8.1 | Paraphrase Flip Rate (%) | 100 |
| MedLayXPlain | 67.2 | S (self-reported) | 96.8 |
| CardioLens | 52.69 | F1 (Random) (self-reported) | 87 |
| PetQA-Bench - Text Helpfulness | 4.87 | Rubric Score (1-5) | 82.4 |
| PetQA-Bench - Multimodal Helpfulness | 4.63 | Rubric Score (1-5) | 60 |
| GPAgentBench-2K - Missed Local Management Rate | 35.2 | Missed local management rate (%; locally manageable cases th | 57.5 |
| PSF-Med - Open Medical - PadChest | 13.9 | Paraphrase Flip Rate (%) | 50 |
| GPAgentBench-2K - Management Accuracy | 52 | Management accuracy (%; episodes ending in the correct pathw | 40 |
| GPAgentBench-2K - Missed Referral Rate | 65.7 | Missed referral rate (%; referral-required cases the agent m | 40 |
| PetQA-Bench - Text Factuality | 50.3 | Factuality (%) | 35.3 |
Interactive version: theaggregate.ai/model?slug=medgemma-27b · How It Works · Data refreshed daily, snapshot 2026-09-26.