Medmarks - Medbullets OP4 — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)90.91
2GPT-5.2 (Medium)90.04
3GPT-5.1 (Medium)89.5
4GLM-4.7 FP887.99
5Grok 487.77
6Qwen 3 235B A22B (Thinking)85.71
7GPT-OSS-120B (High)85.39
8GPT-OSS-120B (Medium)84.31
9Claude Sonnet 4.583.98
10MiniMax-M2.183.87
11Qwen 3 Next 80B A3B (Thinking)82.36
12GPT-OSS-120B (Low)81.6
13MiniMax-M281.39
14INTELLECT-380.63
15Qwen 3 Next 80B A3B Instruct80.19

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medbullets-op4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.