Medmarks - HealthBench Consensus — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)66.16
2GPT-5.1 (Medium)65.72
3GPT-OSS-120B (High)60.45
4Qwen 3 235B A22B (Thinking)58.78
5Gemini 3 Pro (Preview)54.43
6GLM-4.7 FP852.78
7Qwen 3 30B A3B (Thinking)52.47
8Claude Sonnet 4.551.84
9Qwen 3 8B (Thinking)49.06
10GPT-OSS-20B (High)48.83

Interactive version: theaggregate.ai/benchmark?slug=medmarks-healthbench-consensus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.