Medmarks - MedicationQA — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B (Thinking)91.73
2GPT-5.2 (Medium)91.73
3GPT-5.1 (Medium)91.27
4GPT-OSS-120B (High)88.85
5Claude Sonnet 4.588.09
6Gemini 3 Pro (Preview)87.19
7Qwen 3 30B A3B (Thinking)84.68
8GLM-4.7 FP883.88
9GPT-OSS-20B (High)77.52
10Qwen 3 8B (Thinking)75.09

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medicationqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.