Medmarks - MedExQA — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)86.93
2Gemini 3 Pro (Preview)86.6
3GPT-5.1 (Medium)86.18
4Claude Sonnet 4.584.71
5GLM-4.7 FP884.69
6Qwen 3 235B A22B (Thinking)84.65
7GPT-OSS-120B (High)82.83
8Qwen 3 30B A3B (Thinking)80.28
9Qwen 3 8B (Thinking)76.21
10GPT-OSS-20B (High)75.01

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medexqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.