Medmarks - SuperGPQA Medicine Hard — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)60.68
2GPT-5.1 (Medium)52.38
3Qwen 3 Next 80B A3B (Thinking)49.46
4GLM-4.7 FP848.39
5GPT-5.2 (Medium)48.23
6Claude Sonnet 4.547.93
7MiniMax-M2.147.77
8Grok 446.85
9GPT-OSS-120B (High)46.7
10Qwen 3 30B A3B (Thinking)46.39
11Qwen 3 Next 80B A3B Instruct46.24
12Qwen 3 235B A22B (Thinking)45.93
13GPT-OSS-120B (Medium)45.01
14Qwen 3 VL 30B A3B (Thinking)43.63
15INTELLECT-343.32

Interactive version: theaggregate.ai/benchmark?slug=medmarks-supergpqa-medicine-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.