Medmarks - MedQA — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)95.39
2GLM-4.7 FP894.79
3Grok 493.48
4GPT-OSS-120B (High)93.27
5Qwen 3 235B A22B (Thinking)92.96
6Claude Sonnet 4.592.83
7GPT-OSS-120B (Medium)91.54
8Qwen 3 Next 80B A3B (Thinking)91.12
9MiniMax-M2.191.1
10MiniMax-M290.7
11INTELLECT-390.52
12GPT-5.2 (Medium)90.49
13Qwen 3 Next 80B A3B Instruct90.08
14GPT-5.1 (Medium)89.74
15Qwen 3 VL 30B A3B (Thinking)89.08

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.