Medmarks - PubMedQA: leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)81.27
2Llama 3.3 70B Instruct79.33
3Qwen 3 VL 30B A3B (Thinking)78.53
4Grok 478.2
5GPT-OSS-120B (Medium)78.13
6GPT-5.1 (Medium)77.67
7GPT-OSS-120B (Low)77.4
8GLM-4.7 FP877.4
9Qwen 3 235B A22B (Thinking)77.07
10Qwen 3 Next 80B A3B Instruct76.87
11GPT-OSS-120B (High)76.67
12MiniMax-M276.6
13Ling-flash-2.076.47
14GPT-OSS-20B (High)76.33
15Claude Sonnet 4.576.27

Interactive version: theaggregate.ai/benchmark?slug=medmarks-pubmedqa · How It Works · Data refreshed daily, snapshot 2026-09-05.