Medmarks - MedMCQA — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)86.89
2GPT-5.1 (Medium)84.65
3Grok 483.78
4GPT-5.2 (Medium)83.67
5Claude Sonnet 4.580.94
6GLM-4.7 FP880.25
7Qwen 3 235B A22B (Thinking)78.25
8MiniMax-M2.176.8
9MiniMax-M276.32
10Qwen 3 Next 80B A3B (Thinking)76.29
11Qwen 3 Next 80B A3B Instruct76.08
12GPT-OSS-120B (High)75.8
13GPT-OSS-120B (Medium)74.32
14Llama 3.3 70B Instruct74.15
15INTELLECT-373.95

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medmcqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.