EHRBench: leaderboard

Metric: Overall Acc (%) (self-reported). Source: benchmarklist.com. 31 models tracked.

Top models

#ModelScore
1GPT-5.270.91
2GPT-4.169.43
3GPT-569.06
4Llama 3.3 70B67.28
5GPT-4.1 Mini66.79
6Qwen 3 32B66.78
7GPT-5 Mini66.12
8GLM-4 32B66.12
9Qwen 2.5 32B64.97
10Llama 3 70B63.35
11Qwen 3 8B60.87
12Qwen 3 4B60.63
13GPT-4.1 Nano60.48
14glm-4-9B59.62
15Yi 1.5 34B58.94

Interactive version: theaggregate.ai/benchmark?slug=ehrbench · How It Works · Data refreshed daily, snapshot 2026-09-05.