Medmarks - HealthBench — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)64.25
2GPT-5.1 (Medium)63.72
3GPT-OSS-120B (High)58.87
4Qwen 3 235B A22B (Thinking)57.21
5Gemini 3 Pro (Preview)52.17
6Qwen 3 30B A3B (Thinking)50.9
7GLM-4.7 FP850.67
8Claude Sonnet 4.549.29
9Qwen 3 8B (Thinking)47.73
10GPT-OSS-20B (High)47.42

Interactive version: theaggregate.ai/benchmark?slug=medmarks-healthbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.