Medmarks - HEAD-QA v2 — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)93.97
2GPT-5.1 (Medium)92.33
3GPT-5.2 (Medium)91.95
4Grok 491.67
5Claude Sonnet 4.591.45
6GLM-4.7 FP891.32
7Qwen 3 235B A22B (Thinking)90.05
8Qwen 3 Next 80B A3B (Thinking)89.11
9GLM 4.5 Air88.46
10INTELLECT-388.3
11GPT-OSS-120B (High)88.24
12MiniMax-M2.188.02
13MiniMax-M287.81
14Qwen 3 VL 30B A3B (Thinking)87.5
15GPT-OSS-120B (Medium)87.4

Interactive version: theaggregate.ai/benchmark?slug=medmarks-head-qa-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.