Medmarks - PubHealthBench Freeform — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)48.09
2GPT-5.1 (Medium)46.84
3Gemini 3 Pro (Preview)30.13
4Claude Sonnet 4.524.14
5GLM-4.7 FP824.14
6GPT-OSS-120B (High)21.12
7GPT-OSS-20B (High)19.28
8Qwen 3 235B A22B (Thinking)13.62
9Qwen 3 30B A3B (Thinking)10.53
10Qwen 3 8B (Thinking)9.93

Interactive version: theaggregate.ai/benchmark?slug=medmarks-pubhealthbench-freeform · How the rankings work · Data refreshed daily, snapshot 2026-07-22.