Medmarks - MedXpertQA Reasoning — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)70.75
2Grok 445.57
3GPT-5.1 (Medium)45.5
4GLM-4.7 FP843.69
5GPT-5.2 (Medium)42.27
6Claude Sonnet 4.540.66
7GPT-OSS-120B (High)39.21
8Qwen 3 235B A22B (Thinking)36.88
9GPT-OSS-120B (Medium)35.59
10MiniMax-M2.134.41
11MiniMax-M233.82
12Qwen 3 Next 80B A3B (Thinking)32.85
13INTELLECT-331.4
14Qwen 3 Next 80B A3B Instruct29.05
15GPT-OSS-120B (Low)28.93

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medxpertqa-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.