Medmarks - MetaMedQA — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)82.88
2GPT-5.1 (Medium)82.74
3Gemini 3 Pro (Preview)81.67
4Grok 481.67
5GLM-4.7 FP879.85
6GPT-OSS-120B (High)79.39
7Claude Sonnet 4.578.98
8Qwen 3 235B A22B (Thinking)78.03
9MiniMax-M2.177.32
10GPT-OSS-120B (Medium)77.3
11MiniMax-M276.52
12Qwen 3 Next 80B A3B (Thinking)75.38
13INTELLECT-375.31
14GLM 4.5 Air74.58
15GPT-OSS-20B (High)74.29

Interactive version: theaggregate.ai/benchmark?slug=medmarks-metamedqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.