MedHELM: leaderboard

Clinically grounded medical evaluation suite built on HELM, covering medical reasoning, safety, fairness, robustness, and specialty-specific tasks.

Metric: Mean Win Rate (self-reported). Source: benchmarklist.com. Status: saturated. 9 models tracked.

Top models

#ModelScore
1DeepSeek R166.25
2O3 Mini (2025-01-31)64.11
3Claude 3.7 Sonnet (20250219)63.57
4Claude 3.5 Sonnet (20241022)63.39
5GPT-4o (2024-05-13)56.96
6Gemini 2.0 Flash41.96
7GPT-4o Mini (2024-07-18)39.29
8Llama 3.3 70B Instruct30.36
9Gemini 1.5 Pro (001)24.11

Interactive version: theaggregate.ai/benchmark?slug=medhelm · How It Works · Data refreshed daily, snapshot 2026-09-05.