HELM Lite - MedQA: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 91 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)86.28
2Claude 3.5 Sonnet (20241022)85.88
3GPT-4o (2024-05-13)85.69
4Claude 3.5 Sonnet (20240620)82.5
5GPT-4 Turbo (Preview)81.71
6GPT-4 (0613)81.51
7Nova Pro81.11
8DeepSeek V380.91
9Llama 3.1 405B Instruct80.52
10GPT-4 Turbo78.33
11Llama 3 70B77.73
12Mistral Large 2 (Jul)77.53
13Claude 3 Opus (20240229)77.53
14Gemini 1.5 Pro (002)77.14
15Llama 3.1 70B Instruct76.94

Interactive version: theaggregate.ai/benchmark?slug=helm-lite-medqa · How It Works · Data refreshed daily, snapshot 2026-09-19.