Medmarks - PubHealthBench Reviewed — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)94.82
2GPT-5.2 (Medium)94.08
3GPT-5.1 (Medium)93.6
4Grok 491.71
5Claude Sonnet 4.591.49
6GLM-4.7 FP890.7
7MiniMax-M2.190.61
8GPT-OSS-120B (High)88.95
9Llama 3.3 70B Instruct88.25
10GPT-OSS-120B (Medium)88.25
11GPT-OSS-120B (Low)87.89
12Qwen 3 Next 80B A3B Instruct87.68
13Qwen 3 235B A22B (Thinking)87.41
14Ling-flash-2.086.49
15Hermes 4 70B86.32

Interactive version: theaggregate.ai/benchmark?slug=medmarks-pubhealthbench-reviewed · How the rankings work · Data refreshed daily, snapshot 2026-07-22.