Medmarks - MedXpertQA Understanding — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)68.7
2Grok 447.09
3GPT-5.1 (Medium)43.63
4GLM-4.7 FP842.11
5GPT-5.2 (Medium)39.9
6Claude Sonnet 4.536.79
7Qwen 3 235B A22B (Thinking)36.45
8GPT-OSS-120B (High)34.75
9MiniMax-M2.134.24
10GPT-OSS-120B (Medium)31.86
11MiniMax-M231.35
12Qwen 3 Next 80B A3B (Thinking)30.62
13INTELLECT-330.5
14Qwen 3 Next 80B A3B Instruct28.75
15GPT-OSS-120B (Low)27.96

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medxpertqa-understanding · How the rankings work · Data refreshed daily, snapshot 2026-07-22.