HELM MedQA — leaderboard

HELM MedQA: Evaluates clinical, biomedical, medical-exam, coding, or healthcare-document reasoning.

Metric: Exact match (self-reported). Source: benchmarklist.com. Status: saturation imminent. 13 models tracked.

Top models

#ModelScore
1GPT-596.82
2GPT-5 Mini95.63
3O4 Mini94.83
4Gemini 2.5 Pro93.44
5O3 Mini92.05
6GPT-4o87.67
7Claude 3.5 Sonnet86.48
8Claude 3.7 Sonnet85.69
9Gemini 2.0 Flash84.89
10Gemini 1.5 Pro76.94
11GPT-4o Mini74.95

Interactive version: theaggregate.ai/benchmark?slug=helm-medqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.