Medmarks - MedR-Bench Oracle — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)80.01
2GPT-5.1 (Medium)78.56
3Claude Sonnet 4.575.4
4GPT-OSS-120B (High)73.95
5Gemini 3 Pro (Preview)72.61
6GLM-4.7 FP871.34
7GPT-OSS-20B (High)68.1
8Qwen 3 235B A22B (Thinking)65.83
9Qwen 3 8B (Thinking)64.14
10Qwen 3 30B A3B (Thinking)58.29

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medr-bench-oracle · How the rankings work · Data refreshed daily, snapshot 2026-07-22.