Medmarks - MTSamples Procedures — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)88.74
2GPT-5.1 (Medium)86.61
3GPT-OSS-120B (High)86.48
4Qwen 3 235B A22B (Thinking)83.14
5Gemini 3 Pro (Preview)80.22
6GLM-4.7 FP878.56
7Claude Sonnet 4.577.35
8Qwen 3 30B A3B (Thinking)77.29
9GPT-OSS-20B (High)75.6
10Qwen 3 8B (Thinking)69.18

Interactive version: theaggregate.ai/benchmark?slug=medmarks-mtsamples-procedures · How the rankings work · Data refreshed daily, snapshot 2026-07-22.