Medmarks: leaderboard

Living medical-model benchmark spanning verifiable and open-ended clinical evaluation families with model/system comparisons.

Metric: Score (%). Source: medmarks.ai. Status: years away from saturation. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)96.8
2Grok 495.07
3GPT-5.1 (Medium)94.91
4GPT-5.2 (Medium)94.69
5GLM-4.7 FP894.35
6Claude Sonnet 4.593.54
7Qwen 3 235B A22B (Thinking)93.13
8Qwen 3 Next 80B A3B (Thinking)92.14
9MiniMax-M2.191.84
10Qwen 3 Next 80B A3B Instruct91.61
11MiniMax-M291.34
12GPT-OSS-120B (High)90.77
13INTELLECT-390.65
14GPT-OSS-120B (Medium)90.19
15Qwen 3 VL 30B A3B (Thinking)90.11

Interactive version: theaggregate.ai/benchmark?slug=medmarks · How It Works · Data refreshed daily, snapshot 2026-09-05.