HealthBench Hard — leaderboard

Hard subset of HealthBench, evaluating difficult clinical and biomedical advice with physician-written rubrics and stricter scoring.

Metric: Overall score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 55 models tracked.

Top models

#ModelScore
1GPT-OSS-120B60
2Gemma 3 27B59
3Qwen 3 30B A3B 2507 (Thinking)58
4Qwen 3 8B56
5Qwen 3 4B 2507 (Thinking)54
6Qwen 3 32B50
7Qwen 3 235B A22B50
8Qwen 2.5 72B Instruct49
9GPT-OSS-20B48
10DeepSeek R1 Distill Llama 70B47
11Qwen 3 4B43
12Qwen 2.5 7B Instruct42
13DeepSeek V342
14GPT-541.6
15GPT-5.141.4

Interactive version: theaggregate.ai/benchmark?slug=healthbench-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.