Medmarks - MedR-Bench 1-Turn — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)84.17
2GPT-5.1 (Medium)83.28
3Claude Sonnet 4.574.56
4GPT-OSS-120B (High)74.09
5Gemini 3 Pro (Preview)72.57
6GLM-4.7 FP869.54
7GPT-OSS-20B (High)65.94
8Qwen 3 8B (Thinking)60.19
9Qwen 3 235B A22B (Thinking)60.14
10Qwen 3 30B A3B (Thinking)40.49

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medr-bench-1-turn · How the rankings work · Data refreshed daily, snapshot 2026-07-22.