HELM MMLU - Clinical Knowledge: leaderboard

Metric: EM. Source: crfm.stanford.edu. 79 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)92.83
2Claude 3.5 Sonnet (20240620)91.32
3DeepSeek V391.32
4Gemini 1.5 Pro (002)90.57
5GPT-4o (2024-08-06)89.43
6GPT-4o (2024-05-13)89.43
7Gemini 2.0 Flash (Preview)87.92
8Llama 3.1 405B Instruct87.92
9Claude 3 Opus (20240229)87.92
10Nova Pro87.55
11Qwen 2.5 72B Instruct87.17
12Qwen 2 72B Instruct86.79
13Mistral Large 2 (Jul)86.42
14GPT-4 Turbo (Preview)86.42
15Yi Large (Preview)85.66

Interactive version: theaggregate.ai/benchmark?slug=helm-mmlu-clinical-knowledge · How It Works · Data refreshed daily, snapshot 2026-09-08.