HELM MedHELM - Medical Research — leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 13 models tracked.

Top models

#ModelScore
1O3 Mini (2025-01-31)76.39
2GPT-5 (2025-08-07)69.44
3Claude 3.5 Sonnet (20241022)66.67
4O4 Mini (2025-04-16)65.28
5GPT-5 Mini (2025-08-07)55.56
6GPT-4o (2024-05-13)47.22
7DeepSeek R146.53
8Gemini 2.5 Pro (Preview 05-06)45.83
9Gemini 2.0 Flash43.75
10Claude 3.7 Sonnet (20250219)36.11
11Gemini 1.5 Pro (001)32.64
12GPT-4o Mini (2024-07-18)27.08

Interactive version: theaggregate.ai/benchmark?slug=helm-medhelm-medical-research · How the rankings work · Data refreshed daily, snapshot 2026-07-22.