MedGemma-27B: benchmark results

Provider: Other.

Unified ELO 1600 ± 24, rank #451 of 1605 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
PSF-Med - Open Medical9.47Paraphrase Flip Rate (%)100
PSF-Med - Open Medical - MIMIC-CXR6.4Paraphrase Flip Rate (%)100
PSF-Med - Open Medical - VinDr-CXR8.1Paraphrase Flip Rate (%)100
MedLayXPlain67.2S (self-reported)96.8
CardioLens52.69F1 (Random) (self-reported)87
PetQA-Bench - Text Helpfulness4.87Rubric Score (1-5)82.4
PetQA-Bench - Multimodal Helpfulness4.63Rubric Score (1-5)60
GPAgentBench-2K - Missed Local Management Rate35.2Missed local management rate (%; locally manageable cases th57.5
PSF-Med - Open Medical - PadChest13.9Paraphrase Flip Rate (%)50
GPAgentBench-2K - Management Accuracy52Management accuracy (%; episodes ending in the correct pathw40
GPAgentBench-2K - Missed Referral Rate65.7Missed referral rate (%; referral-required cases the agent m40
PetQA-Bench - Text Factuality50.3Factuality (%)35.3

Interactive version: theaggregate.ai/model?slug=medgemma-27b · How It Works · Data refreshed daily, snapshot 2026-09-26.