Medmarks - SuperGPQA Medicine Hard: leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)60.68
2GPT-5.1 (Medium)52.38
3Qwen 3 Next 80B A3B (Thinking)49.46
4GLM-4.7 FP848.39
5GPT-5.2 (Medium)48.23
6Claude Sonnet 4.547.93
7MiniMax-M2.147.77
8Grok 446.85
9GPT-OSS-120B (High)46.7
10Qwen 3 Next 80B A3B Instruct46.24
11Qwen 3 235B A22B (Thinking)45.93
12GPT-OSS-120B (Medium)45.01
13Qwen 3 VL 30B A3B (Thinking)43.63
14INTELLECT-343.32
15GPT-OSS-120B (Low)41.94

Interactive version: theaggregate.ai/benchmark?slug=medmarks-supergpqa-medicine-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.