Medmarks - MedCalc-Bench — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)84.09
2GPT-5.2 (Medium)81.36
3GPT-5.1 (Medium)79.82
4Grok 478
5Claude Sonnet 4.575.91
6GLM-4.7 FP874.45
7GPT-OSS-120B (High)71.73
8Qwen 3 235B A22B (Thinking)69.82
9GPT-OSS-120B (Medium)68.91
10Qwen 3 Next 80B A3B (Thinking)68.27
11MiniMax-M2.166.45
12GPT-OSS-120B (Low)66.09
13Qwen 3 Next 80B A3B Instruct64
14INTELLECT-363.64
15Qwen 3 30B A3B (Thinking)61.82

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medcalc-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.