HELM v2 Lite - MedQA — leaderboard

Metric: Exact Match (%). Source: nlp.stanford.edu. 21 models tracked.

Top models

#ModelScore
1GPT-4 (0613)88.46
2GPT-4 Preview (1106)86.54
3Palmyra X V3 (72B)76.92
4PaLM-2 (Unicorn)76.92
5Yi 34B (Base)73.08
6Claude 271.15
7Claude 2.169.23
8PaLM-2 (Bison)67.31
9Palmyra X V2 (33B)67.31
10Llama 2 70B65.38
11Yi 6B (Chat)61.54
12Mistral-7B-v0.159.62
13GPT-3.5 Turbo (0613)59.62
14text-davinci-00355.77
15text-davinci-00255.77

Interactive version: theaggregate.ai/benchmark?slug=helm-v2-lite-medqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.