EHRBench — leaderboard

Metric: Overall Acc (%) (self-reported). Source: benchmarklist.com. 31 models tracked.

Top models

#ModelScore
1GPT-5.270.91
2GPT-4.169.43
3GPT-569.06
4Llama 3.3 70B Instruct67.28
5GPT-4.1 Mini66.79
6Qwen 3 32B66.78
7GPT-5 Mini66.12
8GLM-4 32B66.12
9Qwen 2.5 32B64.97
10Llama 3 70B63.35
11Qwen 3 8B60.87
12GPT-4.1 Nano60.48
13glm-4-9B59.62
14Yi 1.5 34B58.94
15GPT-5 Nano57.8

Interactive version: theaggregate.ai/benchmark?slug=ehrbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.