Medmarks - MedCaseReasoning — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)52.6
2GPT-5.1 (Medium)48.6
3Gemini 3 Pro (Preview)48
4GPT-OSS-120B (High)45.4
5Claude Sonnet 4.543
6GLM-4.7 FP842.6
7Qwen 3 235B A22B (Thinking)36.6
8GPT-OSS-20B (High)32.6
9Qwen 3 30B A3B (Thinking)29.4
10Qwen 3 8B (Thinking)21.4

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medcasereasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.