Medmarks - PubMedQA — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)81.27
2Llama 3.3 70B Instruct79.33
3Qwen 3 VL 30B A3B (Thinking)78.53
4Grok 478.2
5GPT-OSS-120B (Medium)78.13
6GPT-5.1 (Medium)77.67
7Qwen 3 30B A3B (Thinking)77.47
8GPT-OSS-120B (Low)77.4
9GLM-4.7 FP877.4
10Qwen 3 235B A22B (Thinking)77.07
11Qwen 3 Next 80B A3B Instruct76.87
12GPT-OSS-120B (High)76.67
13MiniMax-M276.6
14Ling-flash-2.076.47
15GPT-OSS-20B (High)76.33

Interactive version: theaggregate.ai/benchmark?slug=medmarks-pubmedqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.