Medmarks - HealthBench Hard — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)44.95
2GPT-5.1 (Medium)43.32
3GPT-OSS-120B (High)36.2
4Qwen 3 235B A22B (Thinking)34.48
5Qwen 3 30B A3B (Thinking)28.07
6Gemini 3 Pro (Preview)27.74
7GPT-OSS-20B (High)26.15
8Claude Sonnet 4.525.85
9GLM-4.7 FP825.13
10Qwen 3 8B (Thinking)24.67

Interactive version: theaggregate.ai/benchmark?slug=medmarks-healthbench-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.